🤖robots.txt для AI-краулеров: кого пускать, кого резать — справочник 2026

Справочник AI-краулеров 2026: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended — кого пускать в robots.txt, чтобы попасть в AI-выдачу, а кого резать.

редакция seodb#robots-txt#ai-краулеры#geo#gptbot#ai-поиск#справочник

Ещё два года назад robots.txt был формальностью, которую генерил движок и никто не открывал. В 2026 это снова инструмент, от которого зависит, увидят ли вас AI-поисковики. Проблема в том, что большинство сайтов управляют доступом ботов наугад: либо пускают всех, либо режут «всё, что похоже на AI», и в обоих случаях делают себе хуже. В первом — отдают контент на обучение чужих моделей, ничего не получая. Во втором — случайно закрывают себя от ChatGPT Search и Perplexity, откуда мог идти трафик.

Ниже — полный справочник AI-краулеров на 2026 год, разбитый по функции, и готовая конфигурация robots.txt для сайта, который хочет быть в AI-выдаче, но не хочет бесплатно кормить обучение моделей.

Главное различие: три типа AI-краулеров

Ключ ко всему — понять, что «AI-бот» это не одна сущность. У каждого крупного вендора несколько ботов с разными задачами, и относиться к ним надо по-разному.

  • Обучающие краулеры собирают контент в датасет для тренировки моделей. Блокировка не влияет на ваш трафик — она только решает, будет ли ваш текст в весах следующей модели. Пример: GPTBot, ClaudeBot, Google-Extended.
  • Поисковые (индексные) краулеры строят индекс, из которого модель берёт цитаты, когда пользователь задаёт вопрос. Заблокировать такой бот = исчезнуть из AI-ответов. Пример: OAI-SearchBot, Claude-SearchBot, PerplexityBot.
  • Агентные (по запросу пользователя) ходят на страницу в реальном времени, когда человек кликнул ссылку в ответе или явно попросил модель прочитать URL. Пример: ChatGPT-User, Claude-User, Perplexity-User.

Отсюда самая частая и дорогая ошибка: заблокировать GPTBot и думать, что закрылись от ChatGPT. Нет. GPTBot — обучающий. За присутствие в ChatGPT Search отвечает отдельный бот OAI-SearchBot, и он живёт по своей строке в robots.txt. Можно (и часто нужно) запретить GPTBot, но разрешить OAI-SearchBot — тогда вы не отдаёте контент на обучение, но остаётесь в поиске ChatGPT.

Справочник user-agent’ов 2026

По вендорам и типам. Строки — ровно то, что писать в User-agent: robots.txt.

User-agent Вендор Тип Блокировать?
GPTBot OpenAI обучение по желанию
OAI-SearchBot OpenAI поиск (ChatGPT Search) нет
ChatGPT-User OpenAI агентный (по клику) нет
ClaudeBot Anthropic обучение по желанию
Claude-SearchBot Anthropic поиск нет
Claude-User Anthropic агентный нет
PerplexityBot Perplexity поиск нет
Perplexity-User Perplexity агентный нет (см. ниже)
Google-Extended Google обучение (Gemini/Vertex) по желанию
Googlebot Google поиск (в т.ч. AI Overviews) никогда
Applebot-Extended Apple обучение по желанию
Bytespider ByteDance обучение часто да
Amazonbot Amazon обучение/ассистент по желанию
Meta-ExternalAgent Meta обучение по желанию
CCBot Common Crawl обучение (используют все) по желанию

Пара уточнений, которые важны на практике:

  • Google-Extended — это не бот, а токен. Отдельного краулера с таким user-agent нет: контент собирает обычный Googlebot, а Google-Extended в robots.txt только говорит, можно ли использовать вашу страницу для обучения Gemini и Vertex AI. Заблокировать Google-Extended безопасно — на ранжирование в Google Search это не влияет.
  • Googlebot трогать нельзя. Google AI Overviews (блок AI-ответов в выдаче) работает поверх обычного индекса Googlebot. Заблокируете Googlebot «за компанию с AI» — вылетите из всего Google разом.
  • Perplexity-User не уважает robots.txt. Perplexity официально заявляет, что Perplexity-User — «агент, а не бот», и потому не обязан подчиняться robots.txt. Это вызвало публичные споры с издателями и Cloudflare. Если вам принципиально закрыть Perplexity — только на уровне WAF/сервера, robots.txt его не остановит.

Яндекс — отдельная логика

У Яндекса нет разделения на обучающий и поисковый токен по модели Google. Яндекс.Нейро использует данные основного индекса, который наполняет YandexBot. Отдельного «Yandex-Extended», которым можно было бы точечно отключить Нейро, не отдав при этом обычный поиск, на момент написания нет. Практический вывод простой: YandexBot не блокировать — иначе выпадете и из поиска, и из Нейро сразу. Управление индексацией под Яндекс делается не через отсечку бота, а через Вебмастер и стандартные директивы. Актуальный статус проверяйте в Яндекс.Вебмастере.

Готовый robots.txt для сайта, который хочет в AI-выдачу

Стандартная стратегия для студии, бизнеса или блога: быть видимым во всех AI-поисковиках, но не отдавать контент на обучение бесплатно. Пускаем поисковые и агентные боты, режем обучающие.

# Обычный поиск — открыт полностью
User-agent: Googlebot
Allow: /

User-agent: YandexBot
Allow: /

# AI-поиск (цитаты в ответах) — открыт
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-User
Allow: /

# Обучение моделей — закрыто
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap-index.xml

Если вы, наоборот, хотите максимального присутствия и вам не жалко контента для обучения (например, для узнаваемости бренда полезно, чтобы модели «знали» ваши формулировки), — просто уберите блок с обучающими ботами и оставьте всё открытым. Это осознанный выбор, а не дефолт «на всякий случай».

robots.txt — это просьба, а не замок

Важно не переоценивать инструмент. robots.txt — декларативный: добросовестные боты (OpenAI, Anthropic, Google) его соблюдают, недобросовестные (часть скраперов, Bytespider в отдельные периоды, тот же Perplexity-User) — нет. Если задача не «попросить не индексировать», а «технически не пустить» — это уровень firewall/WAF и проверки по IP из опубликованных вендорами диапазонов, а не строчка в текстовом файле.

Отдельная ловушка — Cloudflare и хостинги с Bot Fight Mode. Они по дефолту режут часть AI-краулеров ещё до того, как те дойдут до robots.txt. Можно аккуратно разрешить всё в robots.txt и всё равно быть невидимым, потому что запрос заблокировал WAF. Проверять надо не файл, а реальный ответ сервера.

Как проверить, что вас реально пускают

robots.txt вы написали — но видит ли краулер 200? Проверка одной командой на каждый ключевой user-agent:

curl -sI -A "OAI-SearchBot/1.0" https://example.com/ | head -1
curl -sI -A "PerplexityBot/1.0" https://example.com/ | head -1
curl -sI -A "Googlebot/2.1" https://example.com/ | head -1

Ждём HTTP/2 200 для всех, кого вы хотите пустить. Если ловите 403 или 429 — режет сервер или WAF, и никакой Allow: / в robots.txt это не лечит, надо править правила фаервола.

И финальная проверка смыслом: откройте свой robots.txt глазами и по каждой строке спросите — «этот бот приносит мне трафик или забирает контент?». Если приносит (поисковый, агентный) — Allow. Если только забирает (обучающий) и вам это не нужно — Disallow. Всё, что стоит наугад, — потенциальная дыра в видимости.


Автор: Денис Б., seodb.tech — SEO / GEO / AI-поиск. Смежные разборы: ChatGPT Search — 4 шага, чтобы модель начала цитировать сайт · llms.txt — минимум · GEO-чек-лист перед запуском лендинга.