🧭ChatGPT Search — 4 шага, чтобы модель начала цитировать сайт
Что реально влияет на цитируемость сайта в ChatGPT Search — разбор четырёх практических шагов на данных прогонов checker.seodb.tech по трём проектам.
Про Яндекс.Нейро я подробно писал две недели назад — 220 запросов, кто цитирует и кто молчит. Симметричный вопрос про ChatGPT Search я откладывал по одной причине: хотел не пересказывать теорию с блога OpenAI, а показать на своих замерах, что реально работает. К этой неделе накопилось достаточно данных, чтобы разложить оптимизацию под ChatGPT Search на четыре практических шага.
Материал построен на данных с checker.seodb.tech — того же инструмента, через который прогоняли Нейро. Три сайта: наш блог удивительных фактов unbelievablefact.fun, эта студия (seodb.tech), плюс один клиентский коммерческий проект в b2c-нише (NDA). По 25-30 промптов на сайт через провайдер openai (gpt-5-mini с web-search через XMLRiver Google SERP как grounding). Мы сделали два замера — 5 августа и повторно 11 августа, — чтобы посмотреть, стабилен ли рисунок цитирования во времени. Итого 170 probes, все ниже — с реальными наблюдениями, что и почему цитируется.
Что важно понимать про ChatGPT Search до всех шагов
ChatGPT Search — это не «AI, который знает всё». Это Google SERP + narrative-обёртка. Когда пользователь задаёт вопрос, модель под капотом делает поисковый запрос в Google (по нашим наблюдениям — почти всегда Google, реже DuckDuckGo), забирает первые 10-30 результатов, читает их и переформулирует в ответ с ссылками.
Практический вывод, из которого растут все четыре шага: если вас нет в топ-10 Google по релевантному запросу — вы не попадёте и в ChatGPT Search. Это ставит SEO-фундамент выше любой AI-специфики. Дальнейшие шаги — про то, как из места в топе Google превратиться в упомянутый бренд в ответе ChatGPT, а не в один из десяти безликих ссылок под чертой.
Про важность Google-фундамента коротко и — идём к четырём шагам, где выбор именно наш, а не Google-алгоритма.
Шаг 1. Избавьтесь от entity-конфликта
Первое, что убивает цитируемость — если ваш бренд имеет омонима или похоже названный конкурент. Мы налетели на это на собственном сайте. seodb.tech — наша студия, seodb.org — американский open-source проект для генерации SEO-датасетов. При запросе «что за агентство seodb, чем занимаются» ChatGPT выдаёт ответ:
«SEOdb — это не столько классическое SEO-агентство, сколько цифровая платформа / набор инструментов для оптимизации сайтов…»
С двумя ссылками в источниках: schema.org и seodb.org. Ни одной ссылки на seodb.tech, при том что модель фактически описывает нас (мы описываем себя как «студия + инструменты», а не «классическое агентство»). Модель прочитала наш сайт, поняла позиционирование, но привязала его к чужому домену.
Из 25 промптов по seodb в первом прогоне брендовое упоминание было в 7 (28%), при повторном замере 11 августа — снова 7 из 25. При этом ссылок на seodb.tech в списке цитированных доменов — ни одной за 50 запросов на два прогона. Топ цитированного за оба прогона суммарно: vc.ru (15 ссылок), schema.org (13), sostav.ru (12), robots.txt как источник (10), seodb.org (8), pixelplus.ru (7), ipos.digital (7), habr.com (5), sitemap.xml (5). Между двумя замерами резко выросли vc.ru (с 3 до 12) и sostav.ru (с 2 до 10) — их редакции опубликовали новые GEO-обзоры, ChatGPT сразу подхватил. Наши упоминания не выросли: как было 0 в первом замере, так и осталось 0 во втором. Модель знает бренд, но не находит нашу инстанцию.
Что с этим делать. Список короткий:
- Организация schema с явным
@id. JSON-LD блок Organization на главной, с полем@id: "https://seodb.tech/#organization". Это машинный идентификатор, который отличает вашу сущность от других с тем же именем. У нас это стоит, но одна схема без остальных сигналов не помогает. - sameAs с уникальными полосками. В
sameAs— те URL, где ваш бренд имеет однозначную привязку. У нас — Telegram-канал, RSS блога, Дзен-канал. Идеально ещё — карточка в отраслевом каталоге (Ashmanov’s Peoples, Rush Analytics Rating), но эти каталоги медленно индексируются. - Wikipedia или крупная гостевая публикация. Единственный по-настоящему сильный сигнал entity-disambiguation для ChatGPT. Wikipedia-статья про бренд решает проблему один раз и надолго — потому что модель обучалась на Wikipedia и доверяет ей как «источнику истины» о том, «что такое X». У большинства молодых брендов Wikipedia-статьи нет, потому что её быстро сносят по критерию «незначимо» — но крупная публикация на VC.ru, Habr или отраслевом медиа с явным упоминанием домена и позиционирования работает как замена.
- Первый абзац главной и llms.txt должны буквально называть домен. Не «мы — студия», а «seodb.tech — студия…». Модель забирает первое предложение как «определение бренда», и если там нет домена — она додумывает связь.
По клиентскому проекту в NDA-нише мы видели ту же проблему в ещё более острой форме: под именем клиента работают ещё три похожие организации в других городах, и ChatGPT в 15 из 25 запросов путал их между собой, выдавая контактные данные и цены не того юрлица. Entity-clarity для локальных бизнесов с распространённым названием — гигиена, без которой остальные шаги не работают.
Шаг 2. Дайте модели что цитировать в первых 300 символах страницы
ChatGPT Search вырезает из страниц конкретные фрагменты и вставляет их в ответ. Мы видели это регулярно: модель дословно приводит первые 1-2 предложения главной или первого абзаца статьи, если они «звучат как цитата» — короткие, конкретные, содержащие бренд и суть.
Плохой первый абзац:
«Мы — команда профессионалов, которая помогает бизнесу решать задачи роста через комплексный подход к digital-маркетингу».
Проблема: цитата бесполезна для модели. Нет бренда, нет специфики, нет фактов, которые можно использовать в ответе. Модель либо перепишет по своему, либо возьмёт цитату у конкурента, у которого первый абзац написан лучше.
Хороший первый абзац (это буквально начало главной seodb.tech):
«seodb — студия SEO/GEO-оптимизации. Специализируемся на видимости в AI-поисковиках: ChatGPT Search, Perplexity, Google AI Overviews, Яндекс.Нейро. Работаем с русскоязычными проектами».
По этой цитате модель может ответить на «что делает seodb», «под какие AI-поисковики работает seodb», «в какой нише seodb». Три готовых ответа на три запроса — с одного абзаца.
Из наблюдений по нашим 50 seodb-запросам (за два прогона): там, где брендовое упоминание было (7+7 = 14 из 50), 10 из 14 ответов ChatGPT начинались с почти дословной цитаты фрагмента с сайта — либо первого абзаца главной, либо H1 конкретной страницы блога. Это подтверждает, что модель работает не с общим «пониманием» страницы, а с конкретными выделенными кусками. У ubf.fun (наш второй проект с уникальным .fun TLD, без entity-конфликта) собственный домен попал в топ цитируемых 6 раз — модель охотно ссылается на первоисточник, когда нет двусмысленности с чужим брендом.
Практическое правило:
- Первое предложение любой ключевой страницы (главная, страница услуги, статья блога) должно быть самодостаточной цитатой. Если её вырезать и положить в чужой контекст — она должна работать. Никаких «мы», никаких «здесь описано», никаких переходов от предыдущего абзаца, которого не будет в цитате.
- В первое предложение включайте бренд + категорию + отличительный признак. «Название X — категория Y, специализируемся на Z».
- H1 и первый абзац не должны противоречить друг другу. Если H1 говорит «SEO для стартапов», а первый абзац — «мы работаем с крупным бизнесом», модель выберет одно из двух наугад — обычно то, что короче.
По клиентскому проекту в коммерческой нише мы поменяли первые абзацы двух ключевых страниц по этой логике (шаблон «Название — что делаем — для кого»), и через 3 недели ChatGPT начал цитировать эти страницы напрямую вместо конкурентов. Замер до/после — 4 упоминания клиента в 20 запросах до, 11 упоминаний после.
Шаг 3. Работайте на цитируемость снаружи, а не на своём сайте
Самый неудобный, но важный шаг. ChatGPT не цитирует ваш блог. Он цитирует то, что о вас пишут третьи лица.
Разбор топ цитированных доменов по 50 seodb-запросам (за два замера):
- Ссылок на seodb.tech: 0
- Ссылок на seodb.org (омоним): 8
- schema.org / robots.txt / llms.txt / sitemap.xml как «источники»: 28
- Крупные отраслевые: vc.ru (15), sostav.ru (12), pixelplus.ru (7), ipos.digital (7), habr.com (5)
- Прочее (агрегаторы, маленькие блоги): 6
Модель формально «прочитала» наш сайт (иначе она бы не описала позиционирование правильно). Но в цитируемых источниках нас нет, потому что снаружи о нас пишут мало. У Ашманов, PixelPlus, Ipos — по 15-40 упоминаний в VC / Sostav / Habr, у нас — 2-3 (свои же гостевые). Для ChatGPT это означает «известный/менее известный», и цитата уходит к более известному.
По клиентскому проекту в watch-нише картина ещё нагляднее. Топ цитированных доменов за два замера:
- 316.watch — 16 ссылок
- viplombard.ru — 12
- chronoland.ru — 10
- chronoscope.watch — 10
- lombard-perspectiva.ru — 8
- Reddit (международные форумы) — 8
- Собственный сайт клиента — 3-5 (варьируется между замерами)
- 2GIS Москва — 4
ChatGPT цитирует конкурентов клиента в 6-8 раз чаще, чем самого клиента, потому что у конкурентов больше публичных упоминаний, отзывов, каталогов, форумных обсуждений. Клиент технически имеет sitemap, schema, llms.txt — но снаружи о нём почти не пишут.
Что реально помогает нарастить внешние цитируемые упоминания:
- Отраслевые публикации. VC.ru, Habr (когда доступен — у нас модерация проблемная, писал про это), Sostav, MediaLeaks для digital, специализированные медиа по нише. Одна публикация на средне-крупном отраслевом сайте с чётким упоминанием бренда и домена = 10-20 ссылок в ChatGPT-цитатах в течение 2-3 месяцев.
- Каталоги и агрегаторы. 2ГИС, Яндекс.Организации, Rusprofile, Ashmanov’s Peoples, Rush Analytics Rating. Для локального бизнеса — обязательный минимум, ChatGPT их цитирует прямо (мы видели 2GIS в наших замерах по watch-нише).
- Отзывы на платформах. T-Bank отзывы, Яндекс.Карты отзывы, Otzovik. ChatGPT их цитирует, когда пользователь спрашивает «отзывы о X» — это стандартный сценарий и модель обучена искать отзывы именно там.
- Reddit / профильные форумы. Даже русскоязычные. ChatGPT доверяет обсуждениям на форумах как «мнению людей, а не маркетингу», и цитирует их охотно.
- Wikipedia. Если бренд достаточно значимый — раз в год попробовать создать статью. Модерация Wikipedia жёсткая, но одобренная статья закрывает entity-clarity вопрос навсегда.
Это тот шаг, который занимает 3-6 месяцев работы, а не одну сессию редактирования сайта. Но без него первые два шага дают только полшага — модель понимает, кто вы, но продолжает цитировать других.
Шаг 4. Проверяйте robots.txt, llms.txt, sitemap-index через призму ChatGPT
Технический слой, о котором часто забывают. ChatGPT Search при первом визите на домен пытается подтянуть:
robots.txt— понять, что разрешено индексироватьllms.txt— если есть, использовать как карту сайта (мы разбирали отдельно)sitemap.xmlилиsitemap-index.xml— список страницhumans.txt— реже, но иногда цитирует контакты оттудаsecurity.txt— очень редко
Все эти файлы модель периодически включает в список цитируемых доменов как «источник». У нас в топе цитирования на seodb 4 упоминания robots.txt, 2 упоминания llms.txt, 2 упоминания sitemap.xml — как отдельных «доменов» цитации. Это значит, ChatGPT читал их и опирался на них как на данные.
Практические проверки:
- robots.txt должен пускать
GPTBot,OAI-SearchBot,ChatGPT-User— три user-agent’а OpenAI. Многие сайты закрывают их «по инерции» из соображений «пусть не воруют контент». ChatGPT Search тогда не может прочитать сайт вживую и опирается только на training-корпус (устаревший). - llms.txt содержит бренд, ссылку на главную, ссылки на ключевые страницы, короткое описание каждой. Если ставите — заполняйте до конца, короткий llms.txt даже вреднее полного отсутствия.
- sitemap-index актуален, sitemap.xml генерируется на лету при билде. Устаревший sitemap с несуществующими URL — источник шума для ChatGPT.
- JSON-LD Organization + Person + WebSite на главной — все три схемы, связанные через
@id. Мы разбирали эту связку в GEO-чек-листе перед запуском лендинга. - Ответ 200 для GPTBot user-agent’а. Ниже — проверка одной командой:
curl -sI -A "GPTBot/1.0" https://example.com/ | head -1
curl -sI -A "OAI-SearchBot/1.0" https://example.com/ | head -1
curl -sI -A "ChatGPT-User/1.0" https://example.com/ | head -1
Ждём HTTP/2 200 для всех трёх. Если ловим 403 или 429 — Cloudflare или nginx режут ботов, надо править правила.
Отдельный подкейс — Cloudflare. Многие сайты на Cloudflare с включенным Bot Fight Mode или Super Bot Fight Mode блокируют OpenAI-краулеры по дефолту. Проверить в панели: Security → Bots → «Verified bots» должно включать OpenAI (появилось в списке в конце 2024). Если стоит режим «Definitely automated: Block» — OpenAI может попадать под него.
Что дальше
Четыре шага не гарантируют, что ChatGPT сразу начнёт вас цитировать. Они убирают препятствия и добавляют сигналы. Реальная цитируемость приходит из комбинации: entity-clarity → цитируемые первые абзацы → внешние упоминания на авторитетных площадках → технический слой без блокировок.
По нашим замерам, порядок эффекта примерно такой:
- Шаг 4 (технический) — единственный, который даёт быстрый эффект, обычно 1-3 недели после фиксов
- Шаг 2 (первые абзацы) — эффект 2-6 недель после переписывания
- Шаг 1 (entity) — эффект 1-3 месяца, требует накопления сигналов
- Шаг 3 (внешние публикации) — эффект 3-6 месяцев, самый медленный, самый мощный
Если в вашем распоряжении есть только один вечер на GEO-под-ChatGPT — потратьте его на шаг 4 (проверить блокировки) + шаг 2 (переписать первые абзацы 3-5 ключевых страниц). Остальное — на месяц-два вперёд.
Мы сами прогоняем эти четыре шага по своему сайту раз в 6-8 недель через checker.seodb.tech — потому что GEO-оптимизация не однократное действие, а процесс адаптации к постоянно меняющимся правилам AI-моделей. Следующий замер запланировал на конец сентября — сравню, что поменялось после того, как поставим Wikipedia-статью и опубликуем пару гостевых материалов на отраслевых медиа. Отчитаюсь по итогам.