Distributed Machine Learning with PySpark: Migrating Effortlessly from Pandas and Scikit-Learn
Книга посвящена распределённому машинному обучению с использованием PySpark — мощного инструмента для обработки больших данных. Автор показывает, как эффективно перейти от привычных библиотек Pandas и Scikit-Learn к распределённым вычислениям на кластере, сохраняя знакомый синтаксис и подходы.
В начале рассматриваются основы интеграции PySpark с Pandas, демонстрируется схожесть синтаксиса при загрузке данных, выборе столбцов, агрегации, фильтрации, объединении и сохранении данных. Это позволяет читателям быстро адаптировать существующие навыки работы с Pandas к PySpark.
Далее подробно описываются этапы моделирования в распределённой среде, включая подготовку признаков, обучение моделей и оценку качества. Особое внимание уделяется миграции проектов с Scikit-Learn на PySpark MLlib, что делает книгу незаменимой для специалистов по данным, сталкивающихся с ростом объёмов информации.
Книга ориентирована на практиков — data scientists, аналитиков и инженеров машинного обучения, которые хотят масштабировать свои решения без потери производительности и с минимальными изменениями в коде. Примеры кода доступны на GitHub.
