Text Mining with R: A Tidy Approach
Книга «Text Mining with R: A Tidy Approach» — практическое руководство по анализу текстовых данных с использованием языка R и принципов tidy data. Авторы Джулия Силдж и Дэвид Робинсон показывают, как применять современные инструменты R для извлечения знаний из текста: от базовой токенизации до тематического моделирования и анализа тональности.
Основная идея книги — использовать «аккуратный» (tidy) формат данных, где каждая строка представляет один токен (слово, биграмму и т.д.), что упрощает обработку и визуализацию. Читатели научатся работать с пакетами tidytext, dplyr, ggplot2, ggraph и другими, а также конвертировать данные между tidy-форматом и традиционными структурами (матрицы терминов-документов, корпуса).
Книга охватывает анализ тональности с использованием словарей, вычисление tf-idf, анализ n-грамм и корреляций между словами, тематическое моделирование методом LDA, а также включает два практических кейса: сравнение архивов Twitter и анализ метаданных NASA. Примеры построены на текстах Джейн Остин, научных статьях и реальных данных.
Издание предназначено для аналитиков данных, исследователей и разработчиков, знакомых с основами R и желающих освоить методы текстового анализа. Книга не требует глубоких знаний статистики, но даёт прочную основу для практического применения text mining.
