Data Science at the Command Line: Facing the Future with Time-Tested Tools
Практическое руководство, демонстрирующее, как гибкость командной строки помогает специалистам по данным работать быстрее и продуктивнее. Автор показывает, как объединять небольшие, но мощные инструменты командной строки для быстрого получения, очистки, исследования и моделирования данных.
Книга начинается с объяснения философии Unix — простые инструменты, каждый из которых делает одну работу хорошо и умело соединяется в конвейеры. Йерун Янссенс переносит этот подход в область data science, демонстрируя, что командная строка — это не только мир ввода-вывода файлов, но и среда для манипуляции, исследования и даже моделирования данных.
Для быстрого старта — независимо от того, работаете вы в Windows, OS X или Linux — автор разработал Data Science Toolbox: легко устанавливаемое виртуальное окружение с более чем 80 инструментами командной строки. Читатель узнает, почему командная строка является гибкой, масштабируемой и расширяемой технологией.
Даже если вы уже уверенно обрабатываете данные с помощью Python или R, книга поможет значительно улучшить рабочий процесс за счёт использования возможностей командной строки. Рассматриваются извлечение данных с сайтов, API, баз данных и электронных таблиц; очистка текста, CSV, HTML/XML и JSON; описательная статистика и визуализация; управление рабочим процессом; создание переиспользуемых инструментов из однострочников и существующего кода на Python или R.
Отдельное внимание уделено параллелизации и распределению ресурсоёмких конвейеров, а также моделированию данных с помощью алгоритмов снижения размерности, кластеризации, регрессии и классификации. Книга будет полезна как начинающим, так и опытным специалистам по данным, стремящимся к более эффективным и воспроизводимым рабочим процессам.
