Книги / AI и ML / Машинное обучение / PySpark Recipes: A Problem-Solution Approach with PySpark2

PySpark Recipes: A Problem-Solution Approach with PySpark2

Raju Kumar Mishra

PySpark Recipes — это практическое руководство по обработке больших данных с использованием PySpark 2, написанное в формате «проблема-решение». Книга предназначена для разработчиков и аналитиков, которые хотят освоить распределённую обработку данных на Python с помощью Apache Spark.

Книга начинается с обзора эпохи больших данных, экосистемы Hadoop (HDFS, MapReduce), Apache Hive и других фреймворков, после чего переходит к архитектуре Spark и его ключевым компонентам. Основное внимание уделяется практическим рецептам работы с PySpark: созданию RDD, DataFrame и Dataset, трансформациям и действиям, оптимизации запросов и управлению памятью.

Читатели научатся загружать и обрабатывать данные из различных источников, выполнять агрегации, соединения и оконные функции, а также применять Spark SQL и MLlib для машинного обучения. Отдельные главы посвящены потоковой обработке (Spark Streaming) и интеграции с экосистемой Hadoop.

Каждый рецепт содержит чёткую постановку задачи, решение с пояснениями и обсуждение возможных подводных камней. Книга подойдёт как специалистам по данным, так и инженерам, желающим эффективно использовать PySpark для построения масштабируемых конвейеров обработки данных.