Изучаем Spark: молниеносный анализ данных
Книга «Изучаем Spark: молниеносный анализ данных» — это практическое руководство по Apache Spark, написанное разработчиками этой системы кластерных вычислений. Издание адресовано исследователям данных и программистам, которые хотят быстро освоить обработку больших объёмов информации с помощью простого API на Python, Java и Scala.
Авторы подробно объясняют, как организовать параллельное выполнение заданий всего несколькими строками кода, и охватывают широкий спектр примеров — от простых пакетных приложений до программ потоковой обработки данных и алгоритмов машинного обучения.
Книга начинается с введения в анализ данных с помощью Spark, знакомит с унифицированным стеком (Spark Core, Spark SQL, Spark Streaming, MLlib, GraphX) и диспетчерами кластеров. Затем рассматриваются загрузка и настройка Spark, командные оболочки для Python и Scala, а также основы программирования операций с RDD.
Издание будет полезно как начинающим, так и опытным специалистам, желающим эффективно использовать Spark для анализа данных и машинного обучения. Материал сопровождается множеством примеров и рекомендаций от разработчиков проекта.
