Подумайте про ваші улюблені відкриті бази даних.
Я впевнений, що Wikipedia і IMDb миттєво приходять на розум, але вам, можливо, не знадобляться всі ці знання або велика база даних про всі розваги. Іноді вам потрібно трохи VLDB (дуже велика база даних). Щось, що пожвавить ваш аналіз даних Щось, щоб помістити «великий» у ваші великі дані. Дракончик, хороша людина, ти в правильному місці.
Ось 15 великих онлайн баз даних. ви можете отримати доступ і проаналізувати безкоштовно або просто читайте на дозвіллі.
Завершення в 2003 році проекту «Геном людини» (HGP) було тільки початком. Відтоді досягнення в технології секвенування значно скоротили витрати на людину, що дозволило значно розширити HGP від його початкової дослідницької бази в двадцять університетських лабораторій до великої, глобалізованої мережі взаємопов'язаних картографічних засобів геному.
Ви можете завантажити частину проекту «1000 геномів», що містить інформацію про послідовність для понад 2600 осіб з 26 груп населення по всьому світу. Це файл розміром 200 ТБ, так що будьте готові. Ми пропонуємо використовувати його в поєднанні з потужною платформою хмарних обчислень.
Дивіться також: База даних розмірів генома тварин для даних геному, що відносяться до 5635 видів.
Planespotters рай. Велика база даних зображень, що включає 2 532 457 фотографій всіх типів літаків, від найменших окремих літаків до величезних літаючих фортець.
Авіалайнери також мають великий розділ, присвячений даним про літаки та захист історії, який постійно оновлюється у співпраці з виданнями Aerospace Publications для забезпечення достовірності фактів. Це зробило його однією з найбільш докладних авіаційних баз даних в Інтернеті.
Див. також: Спробуйте Planespotters.net для іншого діапазону зображень або SeatGuru для схем розміщення літаків.
Сайт, раніше відомий як Інтернет-архів, зазнав величезних змін. Сайт не сильно змінився з 2002 року, але відтоді багато що змінилося. Інтернет-архів зробив ще більше зростає з перших днів.
Архівуючи все в Інтернеті, сайт надає вам безкоштовний доступ до цифрових медіа, включаючи книги, музику, ігри., відео та багато іншого. Розмір колекції в даний час оцінюється приблизно в 10 петабайт., і оскільки їх веб-сканери продовжують повзти, це продовжить рости.
Freebase - це «створена спільнотою база даних відомих людей, місць і речей», що зберігається в структурі даних, званої графом. Графік складається з вузлів, пов'язаних своїми краями, що дозволило Freebase швидко розширити свій контент, не порушуючи існуючі записи.
На жаль, Freebase, що належить Google, перейшла в режим тільки для читання на початку цього року, перш ніж автономна база даних служби була передана до Фонду Вікімедіа для інтеграції. включені в проект Wikidata (кінець червня 2015 р.). В даний час розробники можуть як і раніше отримувати доступ до Freebase за допомогою існуючих API, але після того, як це відбудеться, розробникам доведеться використовувати API-інтерфейси Вікімедіа для доступу до даних.
З домашньої бази команди мрії про інтернет-знання Google і Вікімедіа ми переходимо до патології. «Знайти могилу» - це велика база даних про поховання з усього світу, що налічує 121 мільйон записів.
Найбільш повні записи надходять зі США, але є невеликі країни з великими даними. У комплекті з фотографіями, цікавими пам'ятниками і безліччю цікавих епітафій... якщо вам потрібне натхнення?
База даних, підтримувана всюдисущою командою розробників Gamespot. GameRankings дає всебічне уявлення про популярність гри, висвітлюючи огляди ігор в автономному режимі і в автономному режимі з надійних джерел.
У тому ж дусі, що і в масивній IMDb, The Big Cartoon Database зосереджена виключно на анімаційних речах: мультфільмах, фільмах, телевізійних шоу, рекламі та багато іншого. Якщо це анімація, ви знайдете її тут, а якщо ні, зареєструйтеся як учасник цієї постійно зростаючої бази даних.
База даних великих мультфільмів має дочірній сайт у базі даних великих коміксів, де зберігаються ще 100 000 або більше записів коміксів., охоплюючи близько 5000 серій, з більш ніж 35 000 сканів. Він також містить комплексну функцію пошуку, в тому числі керівництво за цінами для коміксів з докладним описом поточних цін при перепродажі на різних рівнях оцінки.
Дивіться також: База даних Grand Comics, некомерційна база даних коміксів по всьому світу.
CiteSeer X
Безцінний інструмент для студентів і академіки, CiteSeer X є публічною пошуковою системою і цифровою бібліотекою наукових і наукових робіт. Часто розглянута як перша автоматизована система індексації цитування, вона послужила джерелом натхнення для Google Scholar і Microsoft Academic Search. Хоча останній відтоді був інтегрований у пошукову систему Bing.
CiteSeer X займається індексацією загальнодоступних наукових документів. Якщо ваш дослідницький документ відкрито поширюється, у нього більше шансів з'явитися в пошуковій системі. CiteSeer X є відмінним прикладом сили обміну знаннями, доступної для набагато ширшої аудиторії.
Дивіться також: Google Scholar для різних книг і цитат.
На жаль, немає бази даних кожної фотографії кота в Інтернеті. Тепер це буде щось! WorldCat набагато корисніше, ніж це. Довідковий сайт документує колекції понад 72 000 бібліотек по всьому світу, що охоплюють 170 країн і територій. Це корисно, якщо ви проводите дослідження в іншій країні або просто хочете особисто почитати рідкісні книги.
Єдиним недоліком є метод оновлення. WorldCat використовує модель пакетної обробки, а не дозволяє користувачам отримувати доступ до даних в режимі реального часу. Таким чином, WorldCat не вказує статус позички для каталогізованих книг, незалежно від того, чи належить бібліотека кільком примірникам однієї книги або чи є ця книга безпосередньо доступною для бажаючих відвідати. Це все ще дуже корисний інструмент, особливо коли використовується в поєднанні з CiteSeer X.
«Інтернет-центр довідників, новин та інформації Сімпсонів». Я не міг би висловитися краще. Давній фаворит фанатів почався в далекому 1994 році і досі набирає силу навіть без будь-яких інтерактивних мультимедіа, хоча б для того, щоб уникнути пильного погляду юридичного відділу Фокса.
Ви знайдете одну з найбільших баз даних інструментів налаштування для Windows. тут, починаючи з XP і закінчуючи Windows 8.1. Я впевнений, що Windows 10 не займе багато часу, щоб почати робити раунди. Його величезна популярність спливає з поєднання сил. Власник Stardock субсидує сайт, що означає, що реклами практично немає. Це також виграє від кількості людей, які прямували на сайт зі Stardock.
Ах, подорож провулком ностальгії до бази даних, що нагадує мені, що я ніколи не стану Роджером Вотерсом. Насправді я все ще ледь можу грати, але це інша історія.
Ultimate Guitar Archive, або просто Ultimate-Guitar (UG), налічує понад 1 500 000 зареєстрованих учасників по всьому світу, стежачи за сміховинно великою кількістю контенту спільноти. Це майже приголомшує, скільки інформації, пов'язаної з гітарою, розсіяно з одного джерела. Спільнота просто не підтримує величезну базу даних, вони також часто співпрацюють один з одним, створюючи розгалужені музичні проекти.
Рослини на майбутнє документи екологічно стійкого садівництва. Він має велике значення в поширенні знань про видове розмаїття і важливість пермакультури. Те, що починалося як невеликий проект у надрах Корнуолла, поступово перетворилося на світову базу даних.
Зростання дещо повільне і в основному сфокусоване на пермакультурі у Великобританії та ЄС, але багато записів можна поміняти місцями в США, якщо у вас є дані про види.
Увімкніть цю надбудову Excel для обробки та аналізу даних. Основний сайт Quandl діє як пошук за базою даних, знаходячи бази даних з усього світу, які відповідають вашим умовам пошуку. Спробуйте, якщо вам потрібно поспішати з додатковими даними або просто пограти з великими наборами даних (чесно, а кому ні?!).
Дивіться також: Пошукова система бази даних Enigma.
Набір даних Tiny Images виступає як візуальний словник. Натисніть у будь-якому місці зображення, і з'явиться пошуковий запит з додатковою інформацією. Ви також можете використовувати спеціальні терміни для просіювання 80 мільйонів зображень.
База даних є частиною більш широкого проекту з машинного навчання. сфокусований на навчанні комп'ютерів «бачити» і «читати» смислові поля в зображеннях.