с 2004 года
разработчики №1 в Тюмени
AI

ИИ-боты на сайте: 69% запросов – скраперы, что делать бизнесу

Скраперы для обучения нейросетей дали почти 69% ИИ-трафика на сайтах российских брокеров. Разбираем, каких ботов пускать, каких резать и почему
18.09.2026
ИИ-боты на сайте: 69% запросов – скраперы, что делать бизнесу
Коротко
  • Доля скраперов в ИИ-трафике сайтов российских брокеров выросла с 7% в июне 2026 года до 68,82% в августе: 420 тысяч запросов против 5,5 млн (Servicepipe, CNews, 17 сентября 2026).
  • Больше половины скраперных запросов августа – боты Meta (признана экстремистской организацией, её деятельность запрещена в России), 55,14%. Дальше Claude – 27,78%, GPTBot – 8,83%, Bytespider – 6,36%.
  • Роботы, которые приходят по запросу живого человека, за то же время просели с 33% до 8,78% ИИ-трафика.
  • robots.txt ничего не запрещает, это просьба: в августе 2025 года Cloudflare поймала Perplexity на скрытых краулерах в обход запретов и убрала её из списка верифицированных ботов.
  • Полезный вопрос звучит не «как заблокировать ботов», а «какие данные мы отдаём даром и каким роботам мы рады».

Что произошло с сайтами брокеров за лето

Пять с половиной миллионов запросов за август – столько сделали скраперы к сайтам российских брокеров. В июне было 420 тысяч. Общий ИИ-трафик вырос скромно, с 6 до 8 млн запросов. Поменялся состав: по данным Servicepipe, ассистенты просели с 33% до 8,78%, обычные краулеры – с 60% до 22,4%, а скраперы заняли почти 69%.

Разница принципиальная. Ассистент пришёл потому, что живой человек спросил у нейросети про тарифы, и может привести клиента. Скрапер выкачивает страницы пачками и вынимает тексты, таблицы, котировки в обучающий датасет.

Зам гендиректора Servicepipe Даниил Щербаков связывает всплеск с подготовкой Meta к запуску новых моделей Llama и называет её поведение агрессивным. В «Цифра брокере» объясняют интерес проще: русскоязычных финансовых текстов в открытом вебе мало, а нужны они всем. Брокеры тут – удобный полигон для замера: много страниц, живые цифры, частые обновления. Ровно так же устроены интернет-магазин и медиа.

Кто платит за чужой обучающий датасет

Счёт приходит владельцу сайта: лишние гигабайты, ядра и ответы базы, а на интернет-магазинах с тяжёлым поиском по фильтрам – ещё и лишние секунды для живых покупателей.

Первый рефлекс – закрыть всё. Считаю это ошибкой. Каждый второй россиянин уже делал покупку с помощью ИИ, чаще всего сравнивая товары и характеристики (опрос по заказу Sokolov, сентябрь 2026, выборку не раскрыли). А в ИИ-трафике, который российские площадки признают доверенным, лидирует Алиса – 31%, дальше DeepSeek с 18%, GigaChat с 9%, ChatGPT с 7% и Perplexity с 3% (Servicepipe, первый квартал 2026). Одно правило «резать всех роботов» отрезает и эту витрину.

Оговорка: если у вас сайт-визитка на двести страниц и клиенты приходят по сарафану, не трогайте ничего. Разговор начинается там, где инфраструктура стоит заметных денег, а часть выручки идёт из поиска.

Что с этим делать руками

Тупик, в который упираются почти все, – robots.txt. Cloudflare в августе 2025 года завела чистые домены с прямым запретом на обход, а Perplexity всё равно пересказывала их содержимое: меняла user-agent, адреса и сети, объём скрытого обхода компания оценила в 3–6 млн запросов в сутки. robots.txt объявляет намерение, а ограничивает трафик только тот слой, который проверяет, кто именно пришёл.

Дальше идут решения продуктовые, а не серверные:

  • разделить контент на три корзины: что отдаём любым роботам (карточки, цены, справка), что только людям (выгрузки, история заказов, всё внутри личного кабинета), что вообще не должно лежать в открытом вебе;
  • проверять ботов по владельцу адреса, обратным DNS и сетям вендора, а не по имени в user-agent;
  • поставить лимиты частоты на тяжёлые запросы: поиск с фильтрами, экспорт, API;
  • вывести ИИ-трафик в отдельный отчёт и смотреть на него так же регулярно, как на конверсию.

Мы в CRT видим это на поддержке больших сайтов и личных кабинетов: нагрузка растёт, а в аналитике ничего не меняется, потому что счётчики считают людей. Это видно и по рынку: Servicepipe сообщал о трёхкратном росте обращений за настройкой работы с ИИ-агентами в первом квартале 2026 года.

Вопросы и ответы

Как понять, сколько ИИ-ботов ходит на мой сайт?

Сгруппируйте логи веб-сервера за неделю по user-agent и владельцу IP-адреса. Известные боты (GPTBot, ClaudeBot, Bytespider, PerplexityBot) видны сразу, дальше проверяются те, кто представляется браузером, но ходит с серверных сетей и берёт сотни страниц в минуту. Для ориентира: автоматизированным по итогам 2025 года был примерно каждый 31-й визит на сайт.

Блокировать ИИ-ботов или нет?

Раздельно. Скраперов, которые собирают датасет и дают нагрузку, имеет смысл ограничивать по частоте или блокировать. Ассистентов, приходящих по запросу человека, лучше пускать и следить, чтобы они видели актуальные цены и наличие. Запрет всего автоматизированного – это отказ от канала, который у части аудитории уже заменил поисковую выдачу.

Что делать

Начните с фактов, а не с настроек: выгрузите логи за месяц, посчитайте долю роботов и во что они обходятся по счёту за инфраструктуру. Обычно после этого спорные пункты отпадают сами, а решение принимается за час. Если разбирать это вместе с командой, которая потом отвечает за результат, – мы такое делаем в рамках Discovery.

Обсудить задачу
Материал подготовлен редакцией CRT с использованием ИИ. Факты и цифры проверены по указанным источникам.
← Все статьи
Отвечаем со скоростью света sales@crtweb.ru
свяжитесь с нами
© CRT 2004–2026
Made in Tyumen
Аккредитованная ИТ компания
Запись № 7668 от 10.10.2017 г.
К сайту подключен сервис веб-аналитики Яндекс Метрика, использующий cookie-файлы для анализа пользовательской активности. Вы даете согласие на обработку персональных данных с помощью этого сервиса в порядке, указанном в Политике конфиденциальности
Хорошо