ИИ-краулеры на сайте: GPTBot, ClaudeBot и другие
Новый класс роботов, про который два года назад никто не думал. Кто это такие, чем отличаются от поисковиков и что даёт решение их закрыть.
3 мин чтения
За последние пару лет к привычным поисковым роботам добавился новый класс: краулеры, собирающие тексты для обучения языковых моделей и для ответов в чат-ботах.
Кто ходит
GPTBot — сбор данных для обучения моделей OpenAI. ChatGPT-User — обращение, когда пользователь чата просит открыть конкретную ссылку. ClaudeBot и anthropic-ai — краулеры Anthropic. PerplexityBot — поисковый сервис с ответами. Google-Extended — не отдельный робот, а признак: закрыв его в robots.txt, вы отказываетесь от использования сайта в обучении моделей Google, не теряя обычную индексацию. Bytespider — краулер ByteDance, известен агрессивностью. CCBot — Common Crawl, открытый архив, на котором обучаются многие.
Чем они отличаются от поисковых
Поисковый робот приносит вам трафик: он индексирует страницу, и человек приходит по ссылке. Обмен понятен — вы отдаёте контент, получаете посетителей.
С ИИ-краулерами обмен другой. Модель, обученная на вашем тексте, ответит человеку сама. Ссылка при этом может не появиться вовсе, а если появится, переход по ней происходит редко.
Отдельная разница: интенсивность. Некоторые из них обходят сайты заметно агрессивнее поисковиков, создавая нагрузку, несоизмеримую с отдачей.
Стоит ли закрывать
Однозначного ответа нет, и он зависит от того, чем вы живёте.
Закрывать имеет смысл, если контент — ваш основной актив: медиа, справочники, обучающие материалы, базы отзывов. Вы вложились в тексты, а получаете нагрузку без посетителей.
Не закрывать имеет смысл, если вы продаёте товар или услугу. Упоминание вашего магазина в ответе чат-бота — это то же, что упоминание в статье: оно работает на узнаваемость. Терять его ради экономии трафика странно.
Промежуточный вариант: закрыть обучающие краулеры и оставить те, что
ходят по прямой просьбе пользователя. ChatGPT-User приходит потому,
что человек прямо сейчас попросил открыть вашу ссылку — это фактически
посетитель.
Как закрыть
Через robots.txt — если краулер его соблюдает, а крупные соблюдают:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
Оговорка та же, что и всегда: это просьба. Кто её не соблюдает — не остановится.
Как отличить настоящего от подделки
Прикрыться именем известного краулера — старый приём: авось пропустят как «полезного робота». Проверять надо не строку User-Agent, а принадлежность адреса.
Крупные операторы публикуют диапазоны своих адресов, а часть поддерживает обратный DNS: адрес резолвится в имя в их зоне, а имя — обратно в тот же адрес. Если проверка не сходится, перед вами не краулер, а кто-то, кто им представился, — и это довод против него, а не за.
Что стоит решить заранее
Не «блокировать или нет», а знать, сколько их у вас. Часто оказывается, что доля ИИ-краулеров в трафике измеряется процентами и решать нечего. А иногда — что один из них даёт больше запросов, чем все живые посетители вместе.
Посмотреть на цифры дешевле, чем спорить о принципах.
Читайте также
- Как посчитать долю ботов на своём сайте Средние цифры по рынку бесполезны: доля ботов зависит от тематики и от того, кому вы интересны. Как получить свою цифру, а не среднюю по рынку.
- Сайт под атакой ботов: что делать прямо сейчас Короткая инструкция для ситуации, когда разбираться некогда: сайт тормозит или лёг, и подозрение на ботов.
- Почему блокировка по странам почти не помогает Самое соблазнительное правило в настройках защиты и одно из самых вредных. Объясняем на цифрах и примерах.