20.07.2026
Время прочтения:
seo
Рынок продвижения в нейросетях (GEO) уже наводнён обещаниями «вывести бренд в топ ответов ChatGPT с гарантией». Проблема в том, что такие гарантии противоречат самой архитектуре генеративных систем — и это не маркетинговый тезис, а инженерный факт, который можно проверить на практике. Один из тех, кто занялся этой проверкой предметно, — Майк Кинг (Mike King), основатель технического SEO-агентства iPullRank. Он смоделировал, как агентные RAG-системы на самом деле оценивают, нарезают и ранжируют контент перед тем, как включить его в ответ, и выпустил инструмент Agentic RAG Audit, позволяющий наблюдать этот процесс не в теории, а на реальных чанках реальных страниц. Дальше в статье — что показывает такое моделирование, почему оно ставит крест на любых «гарантиях топа в ИИ», и что в этой ситуации всё-таки имеет смысл делать бизнесу.

Коротко о главном

  • Моделирование поведения RAG-конвейера — а не догадки и не парсинг выдачи задним числом — единственный способ понять, почему один и тот же бренд то появляется в ответе ИИ, то исчезает без видимых причин.
  • Инструментарий в духе Agentic RAG Audit показывает: решение о цитировании принимается не на уровне сайта целиком, а на уровне отдельного чанка — фрагмента текста, который проходит через Cross-Encoder и оценивается независимо от остального контента страницы.
  • Даже при идеально одинаковых входных данных генеративная система не даёт детерминированного результата — это следует из самой математики LLM (параметр температуры t), и никакое моделирование не отменяет этой вариативности, а лишь показывает её границы.
  • Следствие для бизнеса: раз результат непредсказуем в моменте, единственная рабочая стратегия — системно повышать вероятность цитирования через контент, техническую доступность и внешний контур упоминаний. Это дороже классического SEO — по грубым оценкам, в 2-3 раза, — но альтернативы «купить гарантию» просто не существует.

Моделирование RAG-конвейера: почему GEO требует перестройки структуры контента

Стандартный подход агентств — оценивать GEO постфактум: спросить у ChatGPT что-то похожее на реальный запрос клиента и посмотреть, кто процитирован. Это даёт единичный снимок, но не объясняет механику: почему процитирован именно этот абзац, а не соседний с того же сайта.

Моделирование ответа в LLM - RAG

Agentic RAG Audit решает другую задачу — воссоздать сам конвейер обработки контента, который использует агентная RAG-система, и прогнать через него реальные страницы:

  1. Контент разбивается на чанки так, как это делают реальные RAG-агенты — не по абзацам «на глаз», а по логике, близкой к продакшн-системам.
  2. Каждый чанк прогоняется через Cross-Encoder — модель, которая оценивает релевантность фрагмента запросу через механизм внимания, сравнивая буквально каждое слово запроса с каждым словом чанка.
  3. Результат — не бинарный «зайдёт / не зайдёт», а скоринг, показывающий, какие фрагменты страницы физически имеют шанс попасть в выборку для генерации ответа, а какие отсеиваются ещё до того, как до них доберётся языковая модель.

Практический вывод из такого моделирования: страница может быть отлично написана как единое целое и при этом почти не иметь шансов на цитирование — просто потому, что абзацы внутри неё нарезаются так, что смысл теряется на границах чанков. И наоборот — страница с посредственным общим текстом может стабильно давать высокие оценки Cross-Encoder, если отдельные абзацы семантически завершены и содержат конкретные факты.

Это меняет оптику: оптимизировать нужно не сайт «в среднем», а каждый смысловой блок отдельно, как если бы он мог быть процитирован сам по себе, вне контекста остальной страницы.

Вариативность LLM: почему «гарантия топа в ИИ» — это продажа воздуха

Здесь важно не путать две разные вещи: понимание механики отбора контента и предсказание финального ответа.

Моделирование Agentic RAG Audit и подобных инструментов честно показывает первую часть пути — retrieval и чанкинг. Но дальше в дело вступает генерация ответа языковой моделью, и вот на этом этапе детерминизм заканчивается математически, а не из-за несовершенства инструментов анализа.

При параметре температуры t = 0 модель действительно выдавала бы один и тот же ответ на один и тот же запрос — но поисковые ИИ-системы работают не в этом режиме: им нужна живая, разнообразная речь, а не шаблонные повторы. При t > 0 включается элемент случайности выбора токенов, и один и тот же движок на одинаковый запрос в разное время может пойти по разным путям генерации — а значит, процитировать разные источники из одного и того же пула прошедших фильтрацию чанков.

Добавьте сюда три фактора, которые никакое моделирование со стороны не может учесть, потому что они скрыты внутри платформы:

  • История диалога — предыдущие сообщения пользователя меняют вектор текущего запроса, и выдача персонализируется под контекст конкретной беседы.
  • Системный промпт платформы — скрытые инструкции разработчиков (например, приоритет локальным источникам) меняются без предупреждения рынка.
  • Закрытость данных — ни OpenAI, ни Anthropic не публикуют статистику запросов, поэтому вся аналитика GEO, включая самые продвинутые модели вроде Agentic RAG Audit, строится на симуляции retrieval-этапа, а не на данных о реальной генерации внутри чата.
Отсюда прямой вывод: даже самое качественное моделирование RAG-конвейера объясняет, почему вероятность цитирования выше или ниже, но не может сказать, появится ли бренд в конкретном ответе конкретному пользователю в конкретный момент. Это два разных вопроса, и подрядчики, которые смешивают их в одной презентации с обещанием «топ-1 в ChatGPT», либо не понимают архитектуру, либо сознательно вводят клиента в заблуждение.

Что следует делать на практике

Раз моделирование Кинга и похожие инструменты показывают именно вероятностную картину, а не точку попадания, стратегия строится вокруг управления вероятностью на всех этапах, которые бизнес реально контролирует.

Топ-100 органики — обязательное условие входа. Если сайта нет в классической выдаче или ИИ-краулеры (например, GPTBot) заблокированы в robots.txt или файрволом, документ физически не попадёт в пул кандидатов для retrieval — никакое моделирование чанкинга это не исправит, потому что до этапа чанкинга дело просто не дойдёт.

Семантически завершённые абзацы вместо сплошного текста. Практика, которую подтверждает логика Cross-Encoder-оценки: каждый смысловой блок должен содержать субъект, объект и предикат и быть понятным вне контекста соседних абзацев — потому что именно так, по отдельности, его и будет оценивать модель.

Плотность фактов на токен. «Мы лидеры рынка с индивидуальным подходом» — ноль именованных сущностей, фильтр помечает это как шум. «Компенсация за нарушение SLA — до 50 000 рублей, возврат в течение 3 рабочих дней» — конкретные цифры, которые система распознаёт как полезный сигнал.

Внешний контур упоминаний. RAG активно опирается на внешние доверенные источники — отраслевые медиа, крупные UGC-площадки, Википедию. Без внешних подтверждений доверие алгоритма к информации на собственном сайте бренда падает: систему нечем верифицировать.

Калькуляция GEO: почему это в 2–3 раза дороже классического SEO

Честная механика GEO — это не копирайтинг, а системная работа сразу в нескольких направлениях: перестройка структуры контента под чанкинг, постоянный мониторинг доступности сайта для десятков разных ИИ-краулеров и инвестиции во внешний контур (PR, упоминания в СМИ, UGC). По грубым прикидкам это выходит в 2-3 раза дороже классического SEO — просто потому, что классическое SEO решает одну задачу (позиция в индексе), а GEO требует одновременной работы над retrieval, чанкингом и внешней репутацией бренда.

Критерий сравнения Классическое SEO Честное GEO (на основе RAG-аудита) Влияние на бюджет GEO
Ключевая задача Получить высокую позицию (ТОП) в поисковом индексе. Попасть в выборку (retrieval) и пройти фильтр Cross-Encoder для цитирования. Усложнение: Нужно решать две задачи вместо одной.
Единица оптимизации Страница целиком (метатеги, структура, контент в целом). Отдельный чанк (абзац). Каждый блок должен быть семантически завершен. Удорожание: Требует ювелирной переработки всего контента, а не просто написания текста.
Требования к контенту Уникальность, LSI-слова, польза для читателя, объем. Максимальная плотность фактов и именованных сущностей на токен. Минимум «воды». Удорожание: Экспертный контент с фактурой стоит значительно дороже обычного копирайтинга.
Техническая часть Доступность для Googlebot/YandexBot, скорость, микроразметка. Доступность для десятков ИИ-краулеров (GPTBot и др.), валидация структуры чанков. Удорожание: Необходим постоянный мониторинг и настройка серверных правил для новых ботов.
Внешний контур Ссылочная масса (объем и качество ссылок на домен). Упоминания бренда в доверенных источниках (СМИ, Википедия, UGC) для верификации фактов. Удорожание: Работа с репутацией и PR сложнее и дороже простого закупа ссылок.
Результат Детерминированный: Позиция в выдаче относительно стабильна в моменте. Вероятностный: Из-за температуры LLM (t > 0) бренд то появляется, то исчезает в ответах. Вывод: Бюджет идет на системное повышение вероятности, а не на покупку фиксированного места.

Это не повод продавать услугу дороже без обоснования — наоборот, это ровно та цифра, которую стоит показывать клиенту вместе с объяснением, из чего она складывается. Подрядчик, который называет сумму, но не может разложить её на конкретные работы — техническую доступность, структуру контента, внешний контур, — скорее всего, продаёт воздух под модным названием.

Чек-лист для бизнеса: как проверить, за что вы платите в GEO

Если вам предлагают продвижение в нейросетях, эти вопросы быстро покажут уровень подрядчика:

  1. «Какими данными вы подтверждаете, что контент вообще проходит этап чанкинга и Cross-Encoder-фильтрации?» Повод насторожиться: общие фразы про «уникальные и полезные тексты LSI» без упоминания структуры абзацев и микроразметки.
  2. «Как вы учитываете вариативность генерации при температуре t > 0 Признак некомпетентности: обещание «гарантированного первого места в ответе ИИ».
  3. «Работаете ли вы с внешним контуром — упоминаниями, СМИ, UGC — или только с текстом на нашем домене?» Задумайтесь, если ответ будет: «мы работаем только с вашим сайтом, этого достаточно».
  4. «На основе какой методологии вы прогнозируете ROI?» Red flag — ссылка на «закрытую аналитику» без объяснения, как именно она собиралась, учитывая, что ни одна ИИ-платформа не публикует статистику запросов.

Итог

Моделирование вроде Agentic RAG Audit от Майка Кинга не даёт формулу гарантированного попадания в ответ ИИ — и не может её дать, потому что финальный шаг генерации управляется вероятностным распределением, а не детерминированным алгоритмом. Но оно делает важную вещь: показывает, на каких именно этапах — retrieval, чанкинг, пост-фильтрация — бизнес реально может повлиять на шансы, и на каких этапах влияние в принципе невозможно, потому что они скрыты внутри платформы или зависят от температуры генерации.

Практический вывод простой: инвестировать в GEO стоит, но не в обещание результата, а в системную работу над тем, что реально управляемо — техническую доступность сайта для ИИ-ботов, плотность фактов в контенте и внешний контур упоминаний бренда. Это дороже SEO, требует терпения и не даёт красивой цифры «гарантия 100%» — зато основано на том, как система работает на самом деле, а не на том, что удобно продать клиенту.


Дата обновления: 20.07.2026
Назад