robots.txt для нейросетей: как не заблокировать retrieval-ботов
Разбираем robots.txt для ИИ: чем боты обучения моделей отличаются от ботов живого поиска и цитирования, готовый шаблон правил под ChatGPT, Claude, Perplexity и Google, и как проверить, что WAF не блокирует их раньше robots.txt.

Самая частая техническая причина, по которой бренд не появляется в ответах нейросетей — не контент, а одна строка в robots.txt. Владельцы сайтов блокируют «всех ботов ИИ» одним правилом, не подозревая, что среди них — именно те боты, которые формируют ответ пользователю прямо сейчас.
Два типа ботов ИИ — и это принципиально разные вещи
У каждой крупной модели есть как минимум два разных бота, и они решают разные задачи:
- Боты обучения (training). Собирают тексты сайта в датасет для будущих версий модели. Результат этого сбора вы увидите не раньше, чем через месяцы, если увидите вообще. Блокировка таких ботов — законный и частый выбор, который не влияет на то, цитирует ли модель ваш сайт сегодня.
- Боты живого поиска и цитирования (retrieval). Обращаются к сайту в момент, когда пользователь задаёт вопрос с включённым веб-поиском, и именно на основе этого обращения модель решает, упомянуть ли вас в ответе. Заблокировать такого бота — значит физически исключить сайт из ответов, независимо от качества контента.
Проблема в том, что оба типа ботов часто называют одним словом «ИИ-краулеры» и блокируют одним правилом — это и есть техническая ошибка, которая обходится дороже любой ошибки в тексте. Что вообще влияет на выбор источника моделью, помимо доступа, — в статье «Что такое GEO».
Кто есть кто у основных нейросетей
Ниже — боты, которые чаще всего встречаются в логах сайта, и что каждый из них делает.
- OpenAI / ChatGPT.
GPTBot— обучение, блокировка допустима.OAI-SearchBotиChatGPT-User— живой поиск и цитирование в ответах, блокировать нельзя. Подробный разбор — в статье «Как попасть в ответы ChatGPT». - Anthropic / Claude.
ClaudeBot— обучение.Claude-SearchBotиClaude-User— цитирование в ответах с веб-поиском. - Perplexity.
PerplexityBotиндексирует страницы именно для последующего цитирования — по сути весь трафик этого бота работает на видимость в ответах, отдельного «обучающего» бота с широким использованием у Perplexity нет. - Google / Gemini.
Google-Extended— управляет тем, попадёт ли контент в обучение моделей Google, и не совпадает с обычнымGooglebot, от которого зависит и классический поиск, и подмешивание веб-результатов в ответы Gemini. - Яндекс (Алиса, Яндекс Нейро) и GigaChat. Отдельного публичного retrieval-бота с таким же статусом, как у OAI-SearchBot, здесь обычно не выделяют — важнее не блокировать основной индексирующий бот
YandexBotи держать сайт в хорошей индексации. Как проверить фактическую видимость в этих моделях — в статье о проверке GigaChat и Яндекс Нейро, а по Алисе отдельно — в материале «Как попасть в ответы Алисы».
Готовый шаблон robots.txt
Базовый принцип: retrieval-ботов разрешаем всегда и явно, отдельным правилом на каждого — а не «через общее правило для всех», которое легко случайно затронуть при следующей правке файла.
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: *
Allow: /
Training-ботов (GPTBot, ClaudeBot, Google-Extended) в этом шаблоне отдельно не блокируем — они просто попадают под общее правило User-agent: *, как и на geodit.ru. Блокировать их отдельным правилом Disallow — легитимный вариант, если для вас важно ограничить именно обучение моделей на своих данных; на цитирование в живых ответах это не влияет ни так, ни так. Главное — держать это отдельным осознанным решением, а не смешивать с доступом retrieval-ботов.
Проверьте WAF и CDN — это отдельный слой
robots.txt — это просто текстовый файл-договорённость: он не заставляет бота подчиняться, а WAF или CDN (например Cloudflare) могут блокировать запросы ботов на уровне сети — до того, как бот вообще успеет прочитать ваш robots.txt. Часто в этих сервисах есть отдельные переключатели «блокировать AI-ботов» или «блокировать краулеров» — включённые по умолчанию или после общего испуга перед AI-скрейпингом. Это самая незаметная причина, по которой сайт технически «открыт» в robots.txt, но всё равно не появляется в ответах.
Как проверить, что боты действительно допущены
Самая надёжная проверка — не читать правила, а посмотреть на факт: появляется ли сайт в ответах моделей на профильные запросы вашей аудитории. Так вы увидите совокупный эффект robots.txt, WAF, структуры контента и доверия к источнику сразу, а не только один технический пункт. Именно это показывает бесплатный GEO-обзор geodit — по запросам вашей ниши, без ручного перебора моделей по одной.
На своих проектах — maximeter.ru и maxcraft.app — именно доступ для retrieval-ботов был одним из первых пунктов, который проверяли перед остальными правками.
Частые ошибки
- Заблокировать всех ботов с «bot», «AI» или «GPT» в названии одним общим правилом.
- Разобраться с
robots.txt, но забыть про WAF/CDN — правило на сайте есть, а бот всё равно не проходит на уровне сети. - Открыть доступ один раз и не пересматривать список ботов — у моделей появляются новые боты, и старый файл со временем устаревает.
- Считать, что открытый
robots.txtсам по себе гарантирует цитирование — это только необходимое, но не достаточное условие; дальше важны структура и llms.txt.
Проверить, допущены ли нужные боты к вашему сайту прямо сейчас, и получить остальные правки — можно через бесплатный GEO-обзор, а внедрение под ключ возьмёт на себя команда geodit.
Частые вопросы
Блокировка GPTBot в robots.txt мешает попасть в ответы ChatGPT?
Нет. GPTBot собирает данные для обучения будущих моделей, а не для формирования live-ответа. За попадание в ответы ChatGPT с веб-поиском отвечают другие боты — OAI-SearchBot и ChatGPT-User. Их блокировка критична, блокировка GPTBot — нет.
Как понять, что мой сайт уже заблокировал нужных ботов?
Проверьте текущий robots.txt на директивы Disallow для OAI-SearchBot, ChatGPT-User, PerplexityBot, Claude-SearchBot и аналогичных retrieval-ботов, а также правила WAF/CDN — они могут блокировать раньше, чем сайт вообще прочитает robots.txt.
Нужно ли отдельно открывать доступ Яндексу и GigaChat?
Да, но по другой логике: у Яндекса нет отдельного публичного retrieval-бота для Алисы и Нейро — обычно достаточно не блокировать YandexBot. Подробнее о проверке видимости в этих моделях — в статье о проверке GigaChat и Яндекс Нейро.
Узнайте свой GEO Score
Бесплатный GEO обзор покажет, видят ли вас нейросети и кого советуют вместо вас. Без карты.
Проверить сайт бесплатноЕщё по теме


