ПрактикаКоманда geodit7 мин чтения

robots.txt для нейросетей: как не заблокировать retrieval-ботов

Разбираем robots.txt для ИИ: чем боты обучения моделей отличаются от ботов живого поиска и цитирования, готовый шаблон правил под ChatGPT, Claude, Perplexity и Google, и как проверить, что WAF не блокирует их раньше robots.txt.

Файл robots.txt разделяет ботов ИИ на две группы: одни допущены к сайту, другие заблокированы
Изображение сгенерировано нейросетью Gemini 2.5 Flash Image

Самая частая техническая причина, по которой бренд не появляется в ответах нейросетей — не контент, а одна строка в robots.txt. Владельцы сайтов блокируют «всех ботов ИИ» одним правилом, не подозревая, что среди них — именно те боты, которые формируют ответ пользователю прямо сейчас.

Два типа ботов ИИ — и это принципиально разные вещи

У каждой крупной модели есть как минимум два разных бота, и они решают разные задачи:

  • Боты обучения (training). Собирают тексты сайта в датасет для будущих версий модели. Результат этого сбора вы увидите не раньше, чем через месяцы, если увидите вообще. Блокировка таких ботов — законный и частый выбор, который не влияет на то, цитирует ли модель ваш сайт сегодня.
  • Боты живого поиска и цитирования (retrieval). Обращаются к сайту в момент, когда пользователь задаёт вопрос с включённым веб-поиском, и именно на основе этого обращения модель решает, упомянуть ли вас в ответе. Заблокировать такого бота — значит физически исключить сайт из ответов, независимо от качества контента.

Проблема в том, что оба типа ботов часто называют одним словом «ИИ-краулеры» и блокируют одним правилом — это и есть техническая ошибка, которая обходится дороже любой ошибки в тексте. Что вообще влияет на выбор источника моделью, помимо доступа, — в статье «Что такое GEO».

Кто есть кто у основных нейросетей

Ниже — боты, которые чаще всего встречаются в логах сайта, и что каждый из них делает.

  • OpenAI / ChatGPT. GPTBot — обучение, блокировка допустима. OAI-SearchBot и ChatGPT-User — живой поиск и цитирование в ответах, блокировать нельзя. Подробный разбор — в статье «Как попасть в ответы ChatGPT».
  • Anthropic / Claude. ClaudeBot — обучение. Claude-SearchBot и Claude-User — цитирование в ответах с веб-поиском.
  • Perplexity. PerplexityBot индексирует страницы именно для последующего цитирования — по сути весь трафик этого бота работает на видимость в ответах, отдельного «обучающего» бота с широким использованием у Perplexity нет.
  • Google / Gemini. Google-Extended — управляет тем, попадёт ли контент в обучение моделей Google, и не совпадает с обычным Googlebot, от которого зависит и классический поиск, и подмешивание веб-результатов в ответы Gemini.
  • Яндекс (Алиса, Яндекс Нейро) и GigaChat. Отдельного публичного retrieval-бота с таким же статусом, как у OAI-SearchBot, здесь обычно не выделяют — важнее не блокировать основной индексирующий бот YandexBot и держать сайт в хорошей индексации. Как проверить фактическую видимость в этих моделях — в статье о проверке GigaChat и Яндекс Нейро, а по Алисе отдельно — в материале «Как попасть в ответы Алисы».

Готовый шаблон robots.txt

Базовый принцип: retrieval-ботов разрешаем всегда и явно, отдельным правилом на каждого — а не «через общее правило для всех», которое легко случайно затронуть при следующей правке файла.

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: *
Allow: /

Training-ботов (GPTBot, ClaudeBot, Google-Extended) в этом шаблоне отдельно не блокируем — они просто попадают под общее правило User-agent: *, как и на geodit.ru. Блокировать их отдельным правилом Disallow — легитимный вариант, если для вас важно ограничить именно обучение моделей на своих данных; на цитирование в живых ответах это не влияет ни так, ни так. Главное — держать это отдельным осознанным решением, а не смешивать с доступом retrieval-ботов.

Проверьте WAF и CDN — это отдельный слой

robots.txt — это просто текстовый файл-договорённость: он не заставляет бота подчиняться, а WAF или CDN (например Cloudflare) могут блокировать запросы ботов на уровне сети — до того, как бот вообще успеет прочитать ваш robots.txt. Часто в этих сервисах есть отдельные переключатели «блокировать AI-ботов» или «блокировать краулеров» — включённые по умолчанию или после общего испуга перед AI-скрейпингом. Это самая незаметная причина, по которой сайт технически «открыт» в robots.txt, но всё равно не появляется в ответах.

Как проверить, что боты действительно допущены

Самая надёжная проверка — не читать правила, а посмотреть на факт: появляется ли сайт в ответах моделей на профильные запросы вашей аудитории. Так вы увидите совокупный эффект robots.txt, WAF, структуры контента и доверия к источнику сразу, а не только один технический пункт. Именно это показывает бесплатный GEO-обзор geodit — по запросам вашей ниши, без ручного перебора моделей по одной.

На своих проектах — maximeter.ru и maxcraft.app — именно доступ для retrieval-ботов был одним из первых пунктов, который проверяли перед остальными правками.

Частые ошибки

  • Заблокировать всех ботов с «bot», «AI» или «GPT» в названии одним общим правилом.
  • Разобраться с robots.txt, но забыть про WAF/CDN — правило на сайте есть, а бот всё равно не проходит на уровне сети.
  • Открыть доступ один раз и не пересматривать список ботов — у моделей появляются новые боты, и старый файл со временем устаревает.
  • Считать, что открытый robots.txt сам по себе гарантирует цитирование — это только необходимое, но не достаточное условие; дальше важны структура и llms.txt.

Проверить, допущены ли нужные боты к вашему сайту прямо сейчас, и получить остальные правки — можно через бесплатный GEO-обзор, а внедрение под ключ возьмёт на себя команда geodit.

Частые вопросы

Блокировка GPTBot в robots.txt мешает попасть в ответы ChatGPT?

Нет. GPTBot собирает данные для обучения будущих моделей, а не для формирования live-ответа. За попадание в ответы ChatGPT с веб-поиском отвечают другие боты — OAI-SearchBot и ChatGPT-User. Их блокировка критична, блокировка GPTBot — нет.

Как понять, что мой сайт уже заблокировал нужных ботов?

Проверьте текущий robots.txt на директивы Disallow для OAI-SearchBot, ChatGPT-User, PerplexityBot, Claude-SearchBot и аналогичных retrieval-ботов, а также правила WAF/CDN — они могут блокировать раньше, чем сайт вообще прочитает robots.txt.

Нужно ли отдельно открывать доступ Яндексу и GigaChat?

Да, но по другой логике: у Яндекса нет отдельного публичного retrieval-бота для Алисы и Нейро — обычно достаточно не блокировать YandexBot. Подробнее о проверке видимости в этих моделях — в статье о проверке GigaChat и Яндекс Нейро.

Узнайте свой GEO Score

Бесплатный GEO обзор покажет, видят ли вас нейросети и кого советуют вместо вас. Без карты.

Проверить сайт бесплатно

Ещё по теме