Mining of Massive Datasets
Mining of Massive Datasets — классический учебник по интеллектуальному анализу сверхбольших наборов данных, написанный преподавателями Стэнфордского университета. Книга выросла из курсов CS345A, CS246 и CS341 и охватывает алгоритмический подход к data mining, ориентированный на данные, которые не помещаются в оперативную память.
Основное внимание уделено практическим алгоритмам и методам, применимым к веб-данным и графам социальных сетей. Рассматриваются распределённые файловые системы и MapReduce, поиск похожих объектов с помощью minhash и locality-sensitive hashing, потоковая обработка данных, а также технологии поисковых систем, включая PageRank и обнаружение ссылочного спама.
Значительная часть книги посвящена анализу больших графов, кластеризации высокоразмерных данных, частым предметным наборам и ассоциативным правилам, включая алгоритм A-Priori и его улучшения. Отдельные главы описывают задачи интернет-рекламы и рекомендательных систем.
В книге также представлены методы снижения размерности, такие как сингулярное разложение и латентно-семантическое индексирование, а также алгоритмы машинного обучения, применимые к большим данным: перцептроны, метод опорных векторов и градиентный спуск.
Издание содержит множество упражнений разного уровня сложности и сопровождается онлайн-материалами: слайдами, домашними заданиями и экзаменами. Книга предназначена для студентов старших курсов, аспирантов и специалистов, интересующихся анализом больших данных и алгоритмами машинного обучения.
