AI-видимость в цифрах: почему данные на дашборде могут вас обманывать

Рейтинги AI-видимости нестабильны — это статистический шум, а не факт. Разбираем, когда данным можно доверять и как не принять колебание за победу.

Цифра на дашборде — это не факт, это снимок

Смотрите, в чём тут дело. Когда вы отслеживаете AI-видимость — долю упоминаний вашего сайта в ответах ChatGPT, Perplexity или Gemini — вы видите одно число. Скажем, 8%. Красиво и конкретно.

Проблема в том, что это число — один замер. Одна точка из бесконечного потока случайно меняющихся ответов. Генеративные модели намеренно добавляют случайность в каждый ответ, поэтому один и тот же вопрос, заданный дважды, вернёт разные источники. Это не баг — это архитектура.

Исследователи из IQRush протестировали это на практике. Когда одну и ту же тему (снаряжение для бега) раз за разом спрашивали у SearchGPT, один сайт получал около 9,5% упоминаний, другой — около 6%. Разница в 3,5 процентного пункта. Кажется, победитель очевиден? Нет. Разница оказалась внутри погрешности — статистически два сайта были неразличимы.

Если вы когда-либо читали про отслеживание AI-видимости бренда, вы уже знаете: измерять упоминания в нейросетях сложнее, чем кажется. Теперь становится понятно насколько.

Почему AI-рейтинги нестабильны по своей природе

Нейросетевые поисковики не работают как Google. У Google есть более-менее фиксированный индекс и алгоритм — один запрос даёт один результат. У Perplexity, ChatGPT и Gemini каждый ответ — это новая генерация с вариативностью.

Вот три причины, почему рейтинги прыгают:

  • Температура генерации. Модели настроены на случайность, чтобы ответы не были роботизированными. Это хорошо для пользователя, плохо для измерений.
  • Разные платформы — разная логика цитирования. Gemini часто ссылается на одни и те же несколько сайтов внутри одного ответа, поэтому много цитирований не значит много независимых сигналов. SearchGPT цитирует меньше, но разнообразнее — каждый ответ несёт больше уникальной информации.
  • Нет единого «правильного» ответа. Модели не хранят рейтинг источников как таблицу. Каждый раз это вероятностный выбор из возможных вариантов.

Практический вывод: одинаковое количество замеров на Gemini и SearchGPT даёт разный уровень уверенности. Бюджет, которого хватит для Gemini, оставит вас в тумане на SearchGPT.

Сколько замеров нужно, чтобы данным можно было верить

Исследователи поставили простой вопрос: сколько раз нужно задать один вопрос, чтобы рейтинг цитирований стал стабильным? Они протестировали 30 комбинаций платформ и тем.

Результат: от 33 до 94 ответов с цитированиями — в зависимости от платформы и темы. Три из 30 тестов так и не достигли стабильности даже после 125 вопросов. Все три — на SearchGPT, где топовые сайты были слишком похожи по доле, чтобы их можно было разделить.

Тут есть нюанс: считаются только ответы с цитированиями, а не все запросы. SearchGPT часто отвечает без источников. В одном тесте из 125 вопросов только 104 дали цитаты — то есть реально пришлось задать больше, чем кажется по цифрам.

Для рейтинга нужно выполнить два условия одновременно:

  1. Порядок сайтов перестаёт меняться с каждым новым замером.
  2. Разрыв между топовыми сайтами больше, чем погрешность каждого.

Только когда оба условия соблюдены — рейтинг что-то означает. Одного недостаточно.

Как не принять колебание за победу

Типичная ситуация: вы публикуете статью, через неделю смотрите в трекер — доля упоминаний выросла на 3 пункта. «Работает!» — думаете вы. Возможно. А возможно, это просто обычное колебание, которое было бы и без вашей статьи.

Чтобы по-настоящему зафиксировать эффект от изменений, нужно:

  • Замерять до изменения несколько раз, а не один раз.
  • Замерять после тоже несколько раз, а не один.
  • Смотреть не на точечную цифру, а на диапазон с учётом погрешности.

Одно сравнение «до/после» не отделяет ваш вклад от обычного шума. Это как взвеситься один раз утром и один раз вечером и делать выводы о диете.

Полезная подсказка от исследователей: трекер, который говорит «данных пока недостаточно», ценнее трекера, который всегда печатает уверенный рейтинг. Уверенная картинка при недостаточных данных — это не достоинство инструмента, это предупреждение.

Этот же принцип применим шире. Если вы читали про эксперименты в маркетинге, то знаете: без повторных замеров любой «результат теста» — это иллюзия точности.

Что это меняет в работе с AI-видимостью

Давайте по шагам — что конкретно стоит пересмотреть:

Проверьте свой трекер. Он делает один замер и показывает красивое число? Или повторяет запросы и отдаёт диапазон? Первый — удобен, но обманчив. Второй — честнее.

Не сравнивайте с конкурентами по одному снимку. Если вы — 8%, конкурент — 6%, это не означает, что вы впереди. Может означать, что разница внутри погрешности. Верхушку рейтинга ещё можно защитить — лидеры, как правило, отрываются достаточно далеко. Но всё, что ниже первых позиций, — это примерная картина, а не точный порядок.

Не публикуйте рейтинги, которые данные не поддерживают. Если замеров было мало и разрыв маленький — честный ответ «пока не знаем» лучше, чем уверенная таблица.

Учитывайте платформу. На Gemini нужно меньше замеров, чтобы выйти на стабильность. На SearchGPT — больше, и не факт, что вообще выйдете при плотной конкуренции.

Всё это вписывается в более широкую тенденцию: AI-аналитика движется туда, куда давно пришла обычная реклама — к числам с погрешностью вместо псевдоточных цифр. Пока Search Console не показывает, какие клики пришли из AI-поиска, задача проверять данные самостоятельно лежит на вас.

Если вам интересно, как вообще попасть в ответы нейросетей — почитайте про Query Fan-Out и видимость контента в AI-поисковиках. Там другой угол, но связанный.

Что из этого следует на практике

Исследование, о котором идёт речь, — препринт, не прошедший полное рецензирование. 30 тестов — это не огромная выборка. Цифры (33–94 замера) — это ориентир формы проблемы, не таблица умножения, которую можно применять к любой нише напрямую.

Но вывод подтверждён независимо: группа исследователей из Университета Санкт-Галлена провела отдельное исследование и пришла к тому же — один замер ненадёжен, нужно повторять. Это уже не одна точка зрения.

Что это значит для вас как эксперта или маркетолога:

  • Относитесь к данным AI-трекеров как к приблизительным, а не точным.
  • Прежде чем платить за трекинг — спросите у поставщика, сколько раз он делает замер и показывает ли диапазон.
  • Не принимайте решения по контенту на основе одного снимка данных.
  • Радуйтесь, если ваш инструмент умеет говорить «недостаточно данных» — это признак честности, не слабости.

AI-видимость — реальный канал, за которым стоит следить. Но следить с пониманием, что вы видите вероятности, а не факты.

Если хотите разобраться, как выстроить контент, который реально попадает в ответы нейросетей — и при этом не гнаться за нестабильными цифрами — заходите в мой Telegram-канал. Там разборы, примеры и конкретика без воды.

По мотивам материала Search Engine Journal «AI Visibility Rankings Aren’t Stable – New Research Shows It’s Mostly Statistical Noise».

Частые вопросы

Можно ли доверять рейтингам AI-видимости в трекерах?
С осторожностью. Генеративные модели добавляют случайность в каждый ответ, поэтому одна цифра на дашборде — это один замер из множества возможных. Чтобы рейтинг был надёжным, нужно несколько десятков повторных запросов, и разрыв между сайтами должен превышать погрешность.
Сколько раз нужно запрашивать AI, чтобы данные по цитированиям стабилизировались?
По результатам исследования — от 33 до 94 ответов с цитированиями, в зависимости от платформы и темы. На SearchGPT может потребоваться больше, а при плотной конкуренции стабильность вообще не наступает в разумных пределах.
Как отличить реальный рост AI-упоминаний от статистического шума?
Измеряйте несколько раз до изменения контента и несколько раз после. Сравнивайте диапазоны, а не точечные цифры. Рост в пределах обычного колебания платформы — это не доказательство эффекта.
Чем Gemini отличается от SearchGPT при отслеживании AI-видимости?
Gemini часто ссылается на одни и те же сайты внутри одного ответа, поэтому много цитирований не всегда означает много независимых данных. SearchGPT цитирует меньше, но разнообразнее — каждый ответ несёт больше уникальной информации, но для стабильного рейтинга нужно больше замеров.
100 нейросетей для экспертов

100 нейросетей
для экспертов

Подборка, которой реально пользуются — пришлю на почту. Без спама, отписка в один клик.

Для решения
любых задач
Для роста
и эффективности
Для бизнеса
и карьеры

🎁 Заберите 100 нейросетей для экспертов

Комментарии

Будьте первым — поделитесь мыслями или задайте вопрос.

Чтобы оставить комментарий — войдите

Это пара кликов. Чтобы избежать спама — только зарегистрированные пользователи. Никакой рассылки, только если вы сами захотите.