# Парсинг

> Парсинг — извлечение структурированных данных из разрешённых сайтов, RSS-лент или документов. Способ доступа, частота и допустимое использование зависят от правил источника и доступных API.

Источник: https://aiorkestrator.ru/glossary/parsing/

## Как программа читает чужие страницы

Парсер загружает страницу так же, как браузер, но вместо показа человеку разбирает HTML-код и вытаскивает нужные поля: цену, заголовок, текст отзыва. Данные складываются в базу или таблицу и обновляются по расписанию — обычно через cron.

- Цены и ассортимент конкурентов
- Отзывы о компании на картах и площадках
- Новости отрасли из RSS-лент
- Объявления и лоты по заданным фильтрам

## Парсинг HTML, RSS или официальный API

| Критерий | Парсинг HTML | RSS-лента | Официальный API |
| --- | --- | --- | --- |
| Надёжность | Ломается при смене вёрстки | Стабильно, пока лента живёт | Максимальная |
| Полнота данных | Всё, что видно на странице | Только то, что отдаёт лента | Что разрешил владелец |
| Сложность | Выше: правила под каждый сайт | Минимальная | Средняя: ключи, лимиты |
| Когда выбирать | Если разрешённого API или RSS нет | Новости, блоги, публикации | Когда API покрывает нужные данные и условия доступа |

## Примеры из проектов

В SalesOps Cockpit парсер собирает отзывы с Яндекс.Карт, 2ГИС и Avito: негативный отзыв поднимает алерт, AI готовит черновик ответа. Владелец узнаёт о проблеме в день публикации, а не через неделю.

Контент-завод работает на связке «RSS-парсер → фильтрация через LLM → автопубликация»: до 18 материалов в день по заранее заданным правилам, спорные темы уходят на редакторскую проверку.

## Рамки: что можно, а что нельзя

- Персональные данные без согласия собирать нельзя — прямое требование 152-ФЗ
- Условия использования сайта-источника проверяют до запуска: часть площадок прямо запрещает автоматический сбор
- Нагрузку ограничивают паузами между запросами — парсер не должен мешать работе сайта
- Если у источника есть официальный API, правильнее использовать его

## Частые вопросы

### Парсинг — это вообще законно?

Сбор открытых данных сам по себе не запрещён, но есть границы: персональные данные, обход технической защиты, нарушение условий площадки, публикация чужого контента под видом своего. Каждый проект оценивается отдельно — и по задаче, и по источнику.

### Сайт-источник обновил дизайн — всё сломается?

HTML-парсер — да, перестанет находить данные. Поэтому в проект закладывают мониторинг: если данные перестали приходить, уведомление срабатывает сразу, а правила обновляются под новую вёрстку.

### Чем парсинг отличается от интеграции по API?

API — официальная дверь: владелец данных сам решает, что отдавать, формат стабилен. Парсинг — сбор с витрины: доступно всё видимое, но без гарантий. Практичное правило: есть API — используем API, нет — оцениваем парсинг.

## Смежные материалы

- [Мониторинг отзывов на Яндекс.Картах и 2ГИС](https://aiorkestrator.ru/blog/monitoring-otzyvov-yandex-karty-2gis/)
- [Кейс: SalesOps (парсер отзывов)](https://aiorkestrator.ru/cases/salesops/)
- [Услуги автоматизации](https://aiorkestrator.ru/uslugi/)
