За шесть лет разработки я собрал десятки парсеров: для мониторинга цен, сбора вакансий, выгрузки каталогов поставщиков в интернет-магазин. Вопрос можно ли парсить сайты законно всплывает у каждого второго заказчика, и однозначного «да» или «нет» тут нет - всё зависит от того, какие данные вы забираете, с какого сайта и что потом с ними делаете.
По теме статьи
Готовое решение
AI-чатбот для сайта на Claude - отвечает как ваш менеджер, работает 24/7
Подключу к вашему сайту чат-бота на Claude API. Бот отвечает на вопросы клиентов голосом вашего бренда, знает каталог и условия доставки, забирает лиды в CRM или Telegram.
от25 000 ₽
Консультация
Разобраться перед стартом
Созвон 30-60 минут: разбор задачи, аудит текущего решения, рекомендации по стеку. В финале — документ с планом.
от3 000 ₽
Что говорит закон о сборе данных с чужих сайтов
Отдельного закона про парсинг в России нет. Сам факт автоматического обращения к публичной странице ничем не отличается от того, что делает браузер: отправляет HTTP-запрос и получает HTML в ответ. Проблема возникает не на уровне «скрипт против человека», а на уровне того, что именно вы забираете и куда потом эти данные деваете.
Показательное дело - спор «ВКонтакте» против сервиса Double Data в 2017-2018 годах. Компания парсила открытые страницы пользователей соцсети для скоринговых моделей банков. Мосгорсуд признал это нарушением исключительных прав на базу данных по ст. 1334 ГК РФ, хотя каждая отдельная запись была в открытом доступе. Суд смотрел не на то, публична ли информация, а на то, что ответчик системно вытащил существенную часть структурированной базы и построил на ней коммерческий продукт.
Какие данные под защитой: авторские права, база данных, персональные данные
Здесь стоит разделять три разных правовых режима, которые часто путают в одну кучу.
- Тексты, фотографии, описания товаров - объекты авторского права по ст. 1259 ГК РФ. Копирование чужой статьи или карточки товара без разрешения - нарушение, даже если страница открыта без регистрации.
- Каталог, прайс-лист, подборка отзывов как структурированный массив - отдельный объект по ст. 1334 ГК РФ. Изготовитель базы данных вложил силы в её сбор и систематизацию, и закон защищает именно эту работу, а не содержание отдельных записей.
- Имена, телефоны, email, адреса - персональные данные по 152-ФЗ. Сбор с открытых страниц не отменяет требований закона, если данные потом хранятся и обрабатываются: нужно законное основание, а простое «страница была не запаролена» таким основанием не считается.
На практике для заказчика это выглядит так.
| Что делаю | Правовой статус |
|---|---|
| Собираю цены и остатки с открытых страниц каталога | Обычно допустимо, если не копирую базу целиком как продукт |
| Забираю email и телефоны из открытых профилей пользователей | Нужно основание по 152-ФЗ, без него - нарушение |
| Копирую тексты статей и фото товаров себе на сайт | Нарушение авторских прав по ст. 1270 ГК РФ |
| Захожу в раздел, требующий чужой логин и пароль | Может подпадать под ст. 272 УК РФ |
| Мониторю курсы валют, публичные тарифы, расписания | Открытые данные без ограничений доступа, риск минимален |
Бесплатный материал
🎁 Полезный скрипт в подарок
Подпишитесь на Telegram - пришлю готовый скрипт по этой теме.
Без спама. Отписка в 1 клик.
Robots.txt и пользовательское соглашение: что грозит на практике
Robots.txt - это рекомендация для поисковых роботов, а не закон. Файл сам по себе не создаёт юридических обязательств. А вот пользовательское соглашение сайта - обычный гражданско-правовой договор, и если там прямо написано, что автоматический сбор данных запрещён, использование сайта считается согласием с этими условиями.
Из практики: клиент попросил собирать тарифы с сайта поставщика, а в оферте там прямым текстом был запрет на автоматизированный сбор скриптами. В таком случае я не делаю вид, что этого пункта нет, а сразу проговариваю риск: возможен иск о взыскании убытков или просто блокировка по IP без предупреждений. Обычно предлагаю два варианта - написать владельцу сайта и получить официальное согласие, либо поискать открытый API с теми же данными.
Отдельно слежу за нагрузкой на чужой сервер. Для регулярного сбора я обычно настраиваю расписание через n8n - раз в час или реже, вместо непрерывных запросов каждую минуту. Это не юридическое требование само по себе, но резко снижает число жалоб от владельца ресурса и вероятность блокировки.
Парсинг цен конкурентов и мониторинг ассортимента: где грань
Мониторинг публичных цен конкурентов - обычная практика в e‑commerce, и сам по себе он законом не запрещён. Российские суды пока не признавали такой мониторинг нарушением, если данные не копируются как готовая база и не выдаются за собственный продукт.
Проблема возникает в другом сценарии: если собранные цены используются для системного демпинга или иных практик, которые подпадают под признаки недобросовестной конкуренции по 135-ФЗ. Такие дела редкость, но исключать их нельзя, особенно если речь о крупном ритейлере с заметной долей рынка.
Более безопасный путь, который я предлагаю клиентам в e‑commerce - сначала проверить, нет ли у площадки партнёрского API. У Wildberries и Ozon есть официальные API для продавцов с данными по остаткам и ценам, и работа через них снимает сразу и юридические, и технические риски вроде банов по IP.
Технические ограничения и права на автоматизацию сбора
Rate-limit, капча, блокировка по IP - это защитные механизмы, и их наличие само по себе сигнал: владелец сайта не рад автоматическим обращениям к своим страницам. Я в таких случаях не пытаюсь получить данные любой ценой, а сначала смотрю, есть ли официальный способ - API, выгрузка, фид для агрегаторов, экспорт в CSV из личного кабинета.
Если раздел сайта закрыт логином и предназначен только для авторизованных пользователей, доступ к нему без ведома владельца аккаунта может подпадать под ст. 272 УК РФ - неправомерный доступ к компьютерной информации. Поэтому я не берусь за задачи, где нужно тянуть данные из чужих личных кабинетов без прямого согласия их владельца.
Соблюдение rate-limit и robots.txt юридической обязанностью само по себе не является, но снижает число технических блокировок и претензий о недобросовестном использовании чужой инфраструктуры, а на практике именно с этого обычно и начинаются конфликты, а не с самого факта парсинга.
Как я строю парсер, чтобы не нарваться на претензии
Порядок, которого придерживаюсь на каждом проекте, простой.
- Проверяю оферту и robots.txt сайта перед тем, как писать первую строку кода.
- Не собираю персональные данные без законного основания по 152-ФЗ, даже если они видны на открытой странице.
- Если данные персональные, храню их на серверах в России - локализация ПДн требует ст. 18 152-ФЗ, и никакие Google Sheets или зарубежные таблицы тут не подходят.
- Ставлю паузы между запросами и ограничиваю параллельность, чтобы не создавать нагрузку, сравнимую с DDoS.
- Если данные нужны для витрины интернет-магазина или перепродажи, в первую очередь ищу официальный API вместо разбора HTML.
Если нужен парсер под конкретную задачу с учётом этих ограничений, обычно проще заказать разработку парсера на Python под ваш кейс, чем разбираться в тонкостях самостоятельно и потом переделывать. У меня такая разработка начинается от 20 000 ₽, срок обычно от 3 до 7 дней в зависимости от сложности сайта и объёма данных.
Частые вопросы
Нужно ли спрашивать разрешение владельца сайта на парсинг открытых данных?
Формально закон не обязывает спрашивать разрешение на сам факт обращения к публичной странице. Но если в оферте сайта прямо запрещён автоматический сбор данных, использование сайта считается согласием с этими условиями. Если данные критичны для бизнеса, я советую написать владельцу и получить согласие в переписке - это закрывает риски на будущее и часто открывает доступ к более удобному API вместо парсинга HTML.
Что грозит за парсинг персональных данных без согласия?
По ст. 13.11 КоАП РФ штраф для юридических лиц за обработку персональных данных без законного основания составляет от 150 000 до 300 000 рублей, а при повторном нарушении от 300 000 до 500 000 рублей. Дополнительно действует требование хранить персональные данные россиян на серверах в РФ по ст. 18 152-ФЗ, и зарубежные облачные таблицы для этого не подходят.
Можно ли парсить сайт конкурента для мониторинга цен?
Мониторинг публичных цен сам по себе законом не запрещён и широко используется в e‑commerce. Проблемы начинаются, если вы копируете каталог целиком как готовую базу данных или используете полученные цены для практик, которые подпадают под признаки недобросовестной конкуренции по 135-ФЗ.
Как минимизировать юридические риски при автоматическом сборе данных?
Проверяю оферту и robots.txt перед стартом, не собираю персональные данные без основания, ставлю паузы между запросами, чтобы не создавать чрезмерную нагрузку на чужой сервер, и по возможности использую официальный API вместо разбора HTML-страниц.