От парсинга постов к сбору данных: что на самом деле можно достать из Telegram
Habr ·

Я бы сделал начало более естественным и менее похожим на презентацию продукта. Например: В прошлой статье я разбирал, как с помощью Python и Telethon автоматизировать сбор публикаций из Telegram-каналов. Тогда мы фактически решали задачу первого уровня: получили сообщения, забрали текст и сохранили результат. На практике довольно быстро выясняется, что у Telegram-публикации есть гораздо больше интересных данных, чем просто текст. У сообщения есть источник, время публикации, просмотры, реакции, комментарии, медиафайлы и другие связанные данные. Если собирать информацию сразу из нескольких каналов, всё это уже хочется не просто выгрузить в таблицу, а нормально связать между собой. Например, один и тот же пользователь может встречаться сразу в нескольких чатах, а один пост может иметь десятки комментариев и несколько типов реакций. При обычном экспорте такие связи быстро теряются. Поэтому после первой версии парсера я решил пойти немного дальше и посмотреть, что получится, если относиться к Telegram не как к источнику отдельных сообщений, а как к набору связанных данных. В этой статье покажу, как я организовал такой сбор, какие данные можно получить из публикаций и что с ними можно делать после парсинга. Читать далее
Я бы сделал начало более естественным и менее похожим на презентацию продукта. Например: В прошлой статье я разбирал, как с помощью Python и Telethon автоматизировать сбор публикаций из Telegram-каналов. Тогда мы фактически решали задачу первого уровня: получили сообщения, забрали текст и сохранили результат. На практике довольно быстро выясняется, что у Telegram-публикации есть гораздо больше интересных данных, чем просто текст. У сообщения есть источник, время публикации, просмотры, реакции, комментарии, медиафайлы и другие связанные данные. Если собирать информацию сразу из нескольких каналов, всё это уже хочется не просто выгрузить в таблицу, а нормально связать между собой. Например, один и тот же пользователь может встречаться сразу в нескольких чатах, а один пост может иметь десятки комментариев и несколько типов реакций. При обычном экспорте такие связи быстро теряются. Поэтому после первой версии парсера я решил пойти немного дальше и посмотреть, что получится, если относиться к Telegram не как к источнику отдельных сообщений, а как к набору связанных данных. В этой статье покажу, как я организовал такой сбор, какие данные можно получить из публикаций и что с ними можно делать после парсинга. Читать далее