🤖robots.txt для AI-краулеров: кого пускать, кого резать — справочник 2026
Справочник AI-краулеров 2026: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended — кого пускать в robots.txt, чтобы попасть в AI-выдачу, а кого резать.
Ещё два года назад robots.txt был формальностью, которую генерил движок и никто не открывал. В 2026 это снова инструмент, от которого зависит, увидят ли вас AI-поисковики. Проблема в том, что большинство сайтов управляют доступом ботов наугад: либо пускают всех, либо режут «всё, что похоже на AI», и в обоих случаях делают себе хуже. В первом — отдают контент на обучение чужих моделей, ничего не получая. Во втором — случайно закрывают себя от ChatGPT Search и Perplexity, откуда мог идти трафик.
Ниже — полный справочник AI-краулеров на 2026 год, разбитый по функции, и готовая конфигурация robots.txt для сайта, который хочет быть в AI-выдаче, но не хочет бесплатно кормить обучение моделей.
Главное различие: три типа AI-краулеров
Ключ ко всему — понять, что «AI-бот» это не одна сущность. У каждого крупного вендора несколько ботов с разными задачами, и относиться к ним надо по-разному.
- Обучающие краулеры собирают контент в датасет для тренировки моделей. Блокировка не влияет на ваш трафик — она только решает, будет ли ваш текст в весах следующей модели. Пример: GPTBot, ClaudeBot, Google-Extended.
- Поисковые (индексные) краулеры строят индекс, из которого модель берёт цитаты, когда пользователь задаёт вопрос. Заблокировать такой бот = исчезнуть из AI-ответов. Пример: OAI-SearchBot, Claude-SearchBot, PerplexityBot.
- Агентные (по запросу пользователя) ходят на страницу в реальном времени, когда человек кликнул ссылку в ответе или явно попросил модель прочитать URL. Пример: ChatGPT-User, Claude-User, Perplexity-User.
Отсюда самая частая и дорогая ошибка: заблокировать GPTBot и думать, что закрылись от ChatGPT. Нет. GPTBot — обучающий. За присутствие в ChatGPT Search отвечает отдельный бот OAI-SearchBot, и он живёт по своей строке в robots.txt. Можно (и часто нужно) запретить GPTBot, но разрешить OAI-SearchBot — тогда вы не отдаёте контент на обучение, но остаётесь в поиске ChatGPT.
Справочник user-agent’ов 2026
По вендорам и типам. Строки — ровно то, что писать в User-agent: robots.txt.
| User-agent | Вендор | Тип | Блокировать? |
|---|---|---|---|
GPTBot |
OpenAI | обучение | по желанию |
OAI-SearchBot |
OpenAI | поиск (ChatGPT Search) | нет |
ChatGPT-User |
OpenAI | агентный (по клику) | нет |
ClaudeBot |
Anthropic | обучение | по желанию |
Claude-SearchBot |
Anthropic | поиск | нет |
Claude-User |
Anthropic | агентный | нет |
PerplexityBot |
Perplexity | поиск | нет |
Perplexity-User |
Perplexity | агентный | нет (см. ниже) |
Google-Extended |
обучение (Gemini/Vertex) | по желанию | |
Googlebot |
поиск (в т.ч. AI Overviews) | никогда | |
Applebot-Extended |
Apple | обучение | по желанию |
Bytespider |
ByteDance | обучение | часто да |
Amazonbot |
Amazon | обучение/ассистент | по желанию |
Meta-ExternalAgent |
Meta | обучение | по желанию |
CCBot |
Common Crawl | обучение (используют все) | по желанию |
Пара уточнений, которые важны на практике:
- Google-Extended — это не бот, а токен. Отдельного краулера с таким user-agent нет: контент собирает обычный Googlebot, а
Google-Extendedв robots.txt только говорит, можно ли использовать вашу страницу для обучения Gemini и Vertex AI. Заблокировать Google-Extended безопасно — на ранжирование в Google Search это не влияет. - Googlebot трогать нельзя. Google AI Overviews (блок AI-ответов в выдаче) работает поверх обычного индекса Googlebot. Заблокируете Googlebot «за компанию с AI» — вылетите из всего Google разом.
- Perplexity-User не уважает robots.txt. Perplexity официально заявляет, что Perplexity-User — «агент, а не бот», и потому не обязан подчиняться robots.txt. Это вызвало публичные споры с издателями и Cloudflare. Если вам принципиально закрыть Perplexity — только на уровне WAF/сервера, robots.txt его не остановит.
Яндекс — отдельная логика
У Яндекса нет разделения на обучающий и поисковый токен по модели Google. Яндекс.Нейро использует данные основного индекса, который наполняет YandexBot. Отдельного «Yandex-Extended», которым можно было бы точечно отключить Нейро, не отдав при этом обычный поиск, на момент написания нет. Практический вывод простой: YandexBot не блокировать — иначе выпадете и из поиска, и из Нейро сразу. Управление индексацией под Яндекс делается не через отсечку бота, а через Вебмастер и стандартные директивы. Актуальный статус проверяйте в Яндекс.Вебмастере.
Готовый robots.txt для сайта, который хочет в AI-выдачу
Стандартная стратегия для студии, бизнеса или блога: быть видимым во всех AI-поисковиках, но не отдавать контент на обучение бесплатно. Пускаем поисковые и агентные боты, режем обучающие.
# Обычный поиск — открыт полностью
User-agent: Googlebot
Allow: /
User-agent: YandexBot
Allow: /
# AI-поиск (цитаты в ответах) — открыт
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
# Обучение моделей — закрыто
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap-index.xml
Если вы, наоборот, хотите максимального присутствия и вам не жалко контента для обучения (например, для узнаваемости бренда полезно, чтобы модели «знали» ваши формулировки), — просто уберите блок с обучающими ботами и оставьте всё открытым. Это осознанный выбор, а не дефолт «на всякий случай».
robots.txt — это просьба, а не замок
Важно не переоценивать инструмент. robots.txt — декларативный: добросовестные боты (OpenAI, Anthropic, Google) его соблюдают, недобросовестные (часть скраперов, Bytespider в отдельные периоды, тот же Perplexity-User) — нет. Если задача не «попросить не индексировать», а «технически не пустить» — это уровень firewall/WAF и проверки по IP из опубликованных вендорами диапазонов, а не строчка в текстовом файле.
Отдельная ловушка — Cloudflare и хостинги с Bot Fight Mode. Они по дефолту режут часть AI-краулеров ещё до того, как те дойдут до robots.txt. Можно аккуратно разрешить всё в robots.txt и всё равно быть невидимым, потому что запрос заблокировал WAF. Проверять надо не файл, а реальный ответ сервера.
Как проверить, что вас реально пускают
robots.txt вы написали — но видит ли краулер 200? Проверка одной командой на каждый ключевой user-agent:
curl -sI -A "OAI-SearchBot/1.0" https://example.com/ | head -1
curl -sI -A "PerplexityBot/1.0" https://example.com/ | head -1
curl -sI -A "Googlebot/2.1" https://example.com/ | head -1
Ждём HTTP/2 200 для всех, кого вы хотите пустить. Если ловите 403 или 429 — режет сервер или WAF, и никакой Allow: / в robots.txt это не лечит, надо править правила фаервола.
И финальная проверка смыслом: откройте свой robots.txt глазами и по каждой строке спросите — «этот бот приносит мне трафик или забирает контент?». Если приносит (поисковый, агентный) — Allow. Если только забирает (обучающий) и вам это не нужно — Disallow. Всё, что стоит наугад, — потенциальная дыра в видимости.
Автор: Денис Б., seodb.tech — SEO / GEO / AI-поиск. Смежные разборы: ChatGPT Search — 4 шага, чтобы модель начала цитировать сайт · llms.txt — минимум · GEO-чек-лист перед запуском лендинга.