
Коротко о главном
- Моделирование поведения RAG-конвейера — а не догадки и не парсинг выдачи задним числом — единственный способ понять, почему один и тот же бренд то появляется в ответе ИИ, то исчезает без видимых причин.
- Инструментарий в духе Agentic RAG Audit показывает: решение о цитировании принимается не на уровне сайта целиком, а на уровне отдельного чанка — фрагмента текста, который проходит через Cross-Encoder и оценивается независимо от остального контента страницы.
- Даже при идеально одинаковых входных данных генеративная система не даёт детерминированного результата — это следует из самой математики LLM (параметр температуры t), и никакое моделирование не отменяет этой вариативности, а лишь показывает её границы.
- Следствие для бизнеса: раз результат непредсказуем в моменте, единственная рабочая стратегия — системно повышать вероятность цитирования через контент, техническую доступность и внешний контур упоминаний. Это дороже классического SEO — по грубым оценкам, в 2-3 раза, — но альтернативы «купить гарантию» просто не существует.
Моделирование RAG-конвейера: почему GEO требует перестройки структуры контента
Стандартный подход агентств — оценивать GEO постфактум: спросить у ChatGPT что-то похожее на реальный запрос клиента и посмотреть, кто процитирован. Это даёт единичный снимок, но не объясняет механику: почему процитирован именно этот абзац, а не соседний с того же сайта.

Agentic RAG Audit решает другую задачу — воссоздать сам конвейер обработки контента, который использует агентная RAG-система, и прогнать через него реальные страницы:
- Контент разбивается на чанки так, как это делают реальные RAG-агенты — не по абзацам «на глаз», а по логике, близкой к продакшн-системам.
- Каждый чанк прогоняется через Cross-Encoder — модель, которая оценивает релевантность фрагмента запросу через механизм внимания, сравнивая буквально каждое слово запроса с каждым словом чанка.
- Результат — не бинарный «зайдёт / не зайдёт», а скоринг, показывающий, какие фрагменты страницы физически имеют шанс попасть в выборку для генерации ответа, а какие отсеиваются ещё до того, как до них доберётся языковая модель.
Практический вывод из такого моделирования: страница может быть отлично написана как единое целое и при этом почти не иметь шансов на цитирование — просто потому, что абзацы внутри неё нарезаются так, что смысл теряется на границах чанков. И наоборот — страница с посредственным общим текстом может стабильно давать высокие оценки Cross-Encoder, если отдельные абзацы семантически завершены и содержат конкретные факты.
Это меняет оптику: оптимизировать нужно не сайт «в среднем», а каждый смысловой блок отдельно, как если бы он мог быть процитирован сам по себе, вне контекста остальной страницы.
Вариативность LLM: почему «гарантия топа в ИИ» — это продажа воздуха
Здесь важно не путать две разные вещи: понимание механики отбора контента и предсказание финального ответа.
Моделирование Agentic RAG Audit и подобных инструментов честно показывает первую часть пути — retrieval и чанкинг. Но дальше в дело вступает генерация ответа языковой моделью, и вот на этом этапе детерминизм заканчивается математически, а не из-за несовершенства инструментов анализа.
При параметре температуры t = 0 модель действительно выдавала бы один и тот же ответ на один и тот же запрос — но поисковые ИИ-системы работают не в этом режиме: им нужна живая, разнообразная речь, а не шаблонные повторы. При t > 0 включается элемент случайности выбора токенов, и один и тот же движок на одинаковый запрос в разное время может пойти по разным путям генерации — а значит, процитировать разные источники из одного и того же пула прошедших фильтрацию чанков.
Добавьте сюда три фактора, которые никакое моделирование со стороны не может учесть, потому что они скрыты внутри платформы:
- История диалога — предыдущие сообщения пользователя меняют вектор текущего запроса, и выдача персонализируется под контекст конкретной беседы.
- Системный промпт платформы — скрытые инструкции разработчиков (например, приоритет локальным источникам) меняются без предупреждения рынка.
- Закрытость данных — ни OpenAI, ни Anthropic не публикуют статистику запросов, поэтому вся аналитика GEO, включая самые продвинутые модели вроде Agentic RAG Audit, строится на симуляции retrieval-этапа, а не на данных о реальной генерации внутри чата.
Отсюда прямой вывод: даже самое качественное моделирование RAG-конвейера объясняет, почему вероятность цитирования выше или ниже, но не может сказать, появится ли бренд в конкретном ответе конкретному пользователю в конкретный момент. Это два разных вопроса, и подрядчики, которые смешивают их в одной презентации с обещанием «топ-1 в ChatGPT», либо не понимают архитектуру, либо сознательно вводят клиента в заблуждение.
Что следует делать на практике
Раз моделирование Кинга и похожие инструменты показывают именно вероятностную картину, а не точку попадания, стратегия строится вокруг управления вероятностью на всех этапах, которые бизнес реально контролирует.
Топ-100 органики — обязательное условие входа. Если сайта нет в классической выдаче или ИИ-краулеры (например, GPTBot) заблокированы в robots.txt или файрволом, документ физически не попадёт в пул кандидатов для retrieval — никакое моделирование чанкинга это не исправит, потому что до этапа чанкинга дело просто не дойдёт.
Семантически завершённые абзацы вместо сплошного текста. Практика, которую подтверждает логика Cross-Encoder-оценки: каждый смысловой блок должен содержать субъект, объект и предикат и быть понятным вне контекста соседних абзацев — потому что именно так, по отдельности, его и будет оценивать модель.
Плотность фактов на токен. «Мы лидеры рынка с индивидуальным подходом» — ноль именованных сущностей, фильтр помечает это как шум. «Компенсация за нарушение SLA — до 50 000 рублей, возврат в течение 3 рабочих дней» — конкретные цифры, которые система распознаёт как полезный сигнал.
Внешний контур упоминаний. RAG активно опирается на внешние доверенные источники — отраслевые медиа, крупные UGC-площадки, Википедию. Без внешних подтверждений доверие алгоритма к информации на собственном сайте бренда падает: систему нечем верифицировать.
Калькуляция GEO: почему это в 2–3 раза дороже классического SEO
Честная механика GEO — это не копирайтинг, а системная работа сразу в нескольких направлениях: перестройка структуры контента под чанкинг, постоянный мониторинг доступности сайта для десятков разных ИИ-краулеров и инвестиции во внешний контур (PR, упоминания в СМИ, UGC). По грубым прикидкам это выходит в 2-3 раза дороже классического SEO — просто потому, что классическое SEO решает одну задачу (позиция в индексе), а GEO требует одновременной работы над retrieval, чанкингом и внешней репутацией бренда.
| Критерий сравнения | Классическое SEO | Честное GEO (на основе RAG-аудита) | Влияние на бюджет GEO |
|---|---|---|---|
| Ключевая задача | Получить высокую позицию (ТОП) в поисковом индексе. | Попасть в выборку (retrieval) и пройти фильтр Cross-Encoder для цитирования. | Усложнение: Нужно решать две задачи вместо одной. |
| Единица оптимизации | Страница целиком (метатеги, структура, контент в целом). | Отдельный чанк (абзац). Каждый блок должен быть семантически завершен. | Удорожание: Требует ювелирной переработки всего контента, а не просто написания текста. |
| Требования к контенту | Уникальность, LSI-слова, польза для читателя, объем. | Максимальная плотность фактов и именованных сущностей на токен. Минимум «воды». | Удорожание: Экспертный контент с фактурой стоит значительно дороже обычного копирайтинга. |
| Техническая часть | Доступность для Googlebot/YandexBot, скорость, микроразметка. | Доступность для десятков ИИ-краулеров (GPTBot и др.), валидация структуры чанков. | Удорожание: Необходим постоянный мониторинг и настройка серверных правил для новых ботов. |
| Внешний контур | Ссылочная масса (объем и качество ссылок на домен). | Упоминания бренда в доверенных источниках (СМИ, Википедия, UGC) для верификации фактов. | Удорожание: Работа с репутацией и PR сложнее и дороже простого закупа ссылок. |
| Результат | Детерминированный: Позиция в выдаче относительно стабильна в моменте. | Вероятностный: Из-за температуры LLM (t > 0) бренд то появляется, то исчезает в ответах. | Вывод: Бюджет идет на системное повышение вероятности, а не на покупку фиксированного места. |
Это не повод продавать услугу дороже без обоснования — наоборот, это ровно та цифра, которую стоит показывать клиенту вместе с объяснением, из чего она складывается. Подрядчик, который называет сумму, но не может разложить её на конкретные работы — техническую доступность, структуру контента, внешний контур, — скорее всего, продаёт воздух под модным названием.
Чек-лист для бизнеса: как проверить, за что вы платите в GEO
Если вам предлагают продвижение в нейросетях, эти вопросы быстро покажут уровень подрядчика:
- «Какими данными вы подтверждаете, что контент вообще проходит этап чанкинга и Cross-Encoder-фильтрации?» Повод насторожиться: общие фразы про «уникальные и полезные тексты LSI» без упоминания структуры абзацев и микроразметки.
- «Как вы учитываете вариативность генерации при температуре t > 0?» Признак некомпетентности: обещание «гарантированного первого места в ответе ИИ».
- «Работаете ли вы с внешним контуром — упоминаниями, СМИ, UGC — или только с текстом на нашем домене?» Задумайтесь, если ответ будет: «мы работаем только с вашим сайтом, этого достаточно».
- «На основе какой методологии вы прогнозируете ROI?» Red flag — ссылка на «закрытую аналитику» без объяснения, как именно она собиралась, учитывая, что ни одна ИИ-платформа не публикует статистику запросов.
Итог
Моделирование вроде Agentic RAG Audit от Майка Кинга не даёт формулу гарантированного попадания в ответ ИИ — и не может её дать, потому что финальный шаг генерации управляется вероятностным распределением, а не детерминированным алгоритмом. Но оно делает важную вещь: показывает, на каких именно этапах — retrieval, чанкинг, пост-фильтрация — бизнес реально может повлиять на шансы, и на каких этапах влияние в принципе невозможно, потому что они скрыты внутри платформы или зависят от температуры генерации.
Практический вывод простой: инвестировать в GEO стоит, но не в обещание результата, а в системную работу над тем, что реально управляемо — техническую доступность сайта для ИИ-ботов, плотность фактов в контенте и внешний контур упоминаний бренда. Это дороже SEO, требует терпения и не даёт красивой цифры «гарантия 100%» — зато основано на том, как система работает на самом деле, а не на том, что удобно продать клиенту.


