- Доля скраперов в ИИ-трафике сайтов российских брокеров выросла с 7% в июне 2026 года до 68,82% в августе: 420 тысяч запросов против 5,5 млн (Servicepipe, CNews, 17 сентября 2026).
- Больше половины скраперных запросов августа – боты Meta (признана экстремистской организацией, её деятельность запрещена в России), 55,14%. Дальше Claude – 27,78%, GPTBot – 8,83%, Bytespider – 6,36%.
- Роботы, которые приходят по запросу живого человека, за то же время просели с 33% до 8,78% ИИ-трафика.
- robots.txt ничего не запрещает, это просьба: в августе 2025 года Cloudflare поймала Perplexity на скрытых краулерах в обход запретов и убрала её из списка верифицированных ботов.
- Полезный вопрос звучит не «как заблокировать ботов», а «какие данные мы отдаём даром и каким роботам мы рады».
Что произошло с сайтами брокеров за лето
Пять с половиной миллионов запросов за август – столько сделали скраперы к сайтам российских брокеров. В июне было 420 тысяч. Общий ИИ-трафик вырос скромно, с 6 до 8 млн запросов. Поменялся состав: по данным Servicepipe, ассистенты просели с 33% до 8,78%, обычные краулеры – с 60% до 22,4%, а скраперы заняли почти 69%.
Разница принципиальная. Ассистент пришёл потому, что живой человек спросил у нейросети про тарифы, и может привести клиента. Скрапер выкачивает страницы пачками и вынимает тексты, таблицы, котировки в обучающий датасет.
Зам гендиректора Servicepipe Даниил Щербаков связывает всплеск с подготовкой Meta к запуску новых моделей Llama и называет её поведение агрессивным. В «Цифра брокере» объясняют интерес проще: русскоязычных финансовых текстов в открытом вебе мало, а нужны они всем. Брокеры тут – удобный полигон для замера: много страниц, живые цифры, частые обновления. Ровно так же устроены интернет-магазин и медиа.
Кто платит за чужой обучающий датасет
Счёт приходит владельцу сайта: лишние гигабайты, ядра и ответы базы, а на интернет-магазинах с тяжёлым поиском по фильтрам – ещё и лишние секунды для живых покупателей.
Первый рефлекс – закрыть всё. Считаю это ошибкой. Каждый второй россиянин уже делал покупку с помощью ИИ, чаще всего сравнивая товары и характеристики (опрос по заказу Sokolov, сентябрь 2026, выборку не раскрыли). А в ИИ-трафике, который российские площадки признают доверенным, лидирует Алиса – 31%, дальше DeepSeek с 18%, GigaChat с 9%, ChatGPT с 7% и Perplexity с 3% (Servicepipe, первый квартал 2026). Одно правило «резать всех роботов» отрезает и эту витрину.
Оговорка: если у вас сайт-визитка на двести страниц и клиенты приходят по сарафану, не трогайте ничего. Разговор начинается там, где инфраструктура стоит заметных денег, а часть выручки идёт из поиска.
Что с этим делать руками
Тупик, в который упираются почти все, – robots.txt. Cloudflare в августе 2025 года завела чистые домены с прямым запретом на обход, а Perplexity всё равно пересказывала их содержимое: меняла user-agent, адреса и сети, объём скрытого обхода компания оценила в 3–6 млн запросов в сутки. robots.txt объявляет намерение, а ограничивает трафик только тот слой, который проверяет, кто именно пришёл.
Дальше идут решения продуктовые, а не серверные:
- разделить контент на три корзины: что отдаём любым роботам (карточки, цены, справка), что только людям (выгрузки, история заказов, всё внутри личного кабинета), что вообще не должно лежать в открытом вебе;
- проверять ботов по владельцу адреса, обратным DNS и сетям вендора, а не по имени в user-agent;
- поставить лимиты частоты на тяжёлые запросы: поиск с фильтрами, экспорт, API;
- вывести ИИ-трафик в отдельный отчёт и смотреть на него так же регулярно, как на конверсию.
Мы в CRT видим это на поддержке больших сайтов и личных кабинетов: нагрузка растёт, а в аналитике ничего не меняется, потому что счётчики считают людей. Это видно и по рынку: Servicepipe сообщал о трёхкратном росте обращений за настройкой работы с ИИ-агентами в первом квартале 2026 года.
Вопросы и ответы
Как понять, сколько ИИ-ботов ходит на мой сайт?
Сгруппируйте логи веб-сервера за неделю по user-agent и владельцу IP-адреса. Известные боты (GPTBot, ClaudeBot, Bytespider, PerplexityBot) видны сразу, дальше проверяются те, кто представляется браузером, но ходит с серверных сетей и берёт сотни страниц в минуту. Для ориентира: автоматизированным по итогам 2025 года был примерно каждый 31-й визит на сайт.
Блокировать ИИ-ботов или нет?
Раздельно. Скраперов, которые собирают датасет и дают нагрузку, имеет смысл ограничивать по частоте или блокировать. Ассистентов, приходящих по запросу человека, лучше пускать и следить, чтобы они видели актуальные цены и наличие. Запрет всего автоматизированного – это отказ от канала, который у части аудитории уже заменил поисковую выдачу.
Что делать
Начните с фактов, а не с настроек: выгрузите логи за месяц, посчитайте долю роботов и во что они обходятся по счёту за инфраструктуру. Обычно после этого спорные пункты отпадают сами, а решение принимается за час. Если разбирать это вместе с командой, которая потом отвечает за результат, – мы такое делаем в рамках Discovery.
Обсудить задачуИсточники
- CNews: американские компании собирают данные российских брокеров для обучения ИИ
- Ведомости: зарубежные ИИ-боты активно собирают данные с сайтов российских брокеров
- Хабр: в России зафиксировали рост доли ИИ-трафика на сайтах СМИ и электронной коммерции
- CISO Club: Servicepipe фиксирует трёхкратный рост запросов на настройку работы с ИИ-агентами
- Cloudflare Blog: Perplexity использует скрытые краулеры в обход запретов сайтов
- CNews: каждый второй россиянин делал покупку с помощью искусственного интеллекта
