Парсинг сайтов в России не запрещён как технология. Но конкретный сбор может затрагивать авторские права, исключительное право изготовителя базы данных, персональные данные, договорные ограничения и права владельца информационной системы. Поэтому универсального ответа «можно парсить любой открытый сайт» нет.
Наиболее управляемый путь начинается с официального API или согласованной выгрузки. Если требуется сбор страниц, заранее фиксируют нужные поля, основание использования, допустимую нагрузку и признаки, при которых процесс останавливается.
Важно: материал носит информационный характер и не заменяет юридическое заключение по конкретному источнику и сценарию.
Когда риск ниже, а когда выше?
Риск обычно ниже, когда владелец источника предусмотрел API, объём сбора ограничен задачей, а данные не содержат чужих произведений и сведений о людях. Он растёт при обходе ограничений, переносе каталога целиком, высокой нагрузке и использовании персональных данных без установленного основания.
| Ниже риск | Выше риск |
|---|---|
| Официальный API или разрешение | Обход авторизации, CAPTCHA или технических ограничений |
| Небольшой набор фактических полей | Копирование текстов, фотографий или существенной части базы |
| Обезличенные агрегаты | Сбор контактов и профилей физических лиц |
| Редкая контролируемая загрузка | Нагрузка, мешающая работе источника |
Пять групп рисков
До разработки источник проверяют по четырём отдельным направлениям. Отсутствие риска в одном из них не снимает остальные: разрешение на доступ, например, не передаёт права на фотографии и не создаёт основание для обработки персональных данных.
- Контент. Тексты, фотографии, дизайн и иные произведения могут охраняться авторским правом.
- База данных. Существенное извлечение материалов может затронуть право изготовителя базы.
- Персональные данные. Публикация сведений в интернете не отменяет требований к их обработке.
- Доступ и договор. Условия использования и технические ограничения могут запрещать выбранный способ.
Что проверить в персональных данных?
Сначала определяют, относятся ли поля к конкретному человеку, затем фиксируют цель, роль оператора и основание обработки по статье 6 закона №152-ФЗ. Согласие бывает одним из оснований, но не единственным. Для персональных данных, разрешённых субъектом для распространения, статья 10.1 устанавливает специальный режим и условия.
- есть ли сведения о конкретном человеке
- какова цель и правовое основание
- нужны ли все собираемые поля
- где данные записываются и хранятся
- кому они передаются
- как выполняются удаление и уточнение
Закон №152-ФЗ относит к обработке сбор, запись, систематизацию, извлечение, использование и передачу. Факт нахождения сведений в открытом интернете сам по себе не создаёт универсального основания.
Факты, произведения и база данных
Сведения о фактах сами по себе не относятся к объектам авторского права по статье 1259 ГК РФ. Оригинальное описание, фотография и оформление карточки могут охраняться отдельно. Массовое извлечение материалов из систематизированного массива также оценивается отдельно от прав на каждый элемент. Статья 1334 ГК РФ предусматривает исключительное право изготовителя базы, создание которой потребовало существенных затрат.
Поэтому задача «сравнивать пять цен» и задача «перенести чужой каталог целиком» имеют разный профиль риска. Состав выгрузки и долю базы следует обсуждать до разработки.
Что означают robots.txt и технические ограничения?
RFC 9309 описывает robots.txt как протокол правил для автоматических клиентов. Совместимый с RFC краулер должен учитывать эти правила, но файл не предоставляет авторизацию, не является лицензией на данные и не определяет законность их использования.
Чек-лист до запуска
- 01
Опишите цель
Какое решение принимает бизнес и какие поля для него нужны.
- 02
Найдите официальный канал
API, экспорт, открытые данные или соглашение.
- 03
Проверьте права
Контент, база, персональные данные и условия сайта.
- 04
Ограничьте сбор
Частота, объём, кэш и автоматическая остановка.
- 05
Зафиксируйте решение
Источники, основания, владельца и срок пересмотра.
Техническую часть процесса мы разобрали в статье о парсинге сайтов для бизнеса. Для данных торговых площадок полезен разбор официальных API маркетплейсов, а состав полей и ограничения стоит закрепить в техническом задании.
Частые вопросы
Можно ли парсить публично доступные страницы?
Публичный доступ не означает автоматического разрешения на любое копирование и использование. Нужно отдельно проверить состав данных, права, условия сайта, цель и способ сбора.
Разрешение в robots.txt делает парсинг законным?
Нет. robots.txt передаёт правила сканирования автоматическим клиентам, но не является лицензией, договором или основанием обработки персональных данных.
Можно ли собирать цены товаров?
Факты и цены сами по себе рассматриваются иначе, чем охраняемые тексты, фотографии или существенная часть базы. Но способ, масштаб, договорные условия и дальнейшее использование всё равно требуют проверки.
Нужно ли согласие владельца сайта?
Это зависит от источника и сценария. Самый устойчивый вариант для регулярного коммерческого обмена: официальный API, выгрузка, партнёрское соглашение или письменное разрешение.
Заменяет ли статья консультацию юриста?
Нет. Материал помогает выявить вопросы до разработки. Решение по конкретному источнику и данным следует подтвердить с юристом.
Источники и границы материала
- ГК РФ, статья 1259: объекты авторских прав
- ГК РФ, статья 1270: исключительное право на произведение
- ГК РФ, статья 1334: право изготовителя базы данных
- Федеральный закон №152-ФЗ о персональных данных
- RFC 9309: Robots Exclusion Protocol
Материал носит информационный характер. Конкретная архитектура, бюджет, режим работы с данными и уровень человеческого контроля зависят от процесса и требований компании.
Проверьте источник до разработки
Опишите данные, объём, частоту и дальнейшее использование. Мы выделим технические ограничения и вопросы, которые нужно передать юристу.
