К содержимому
Разбор

Спросите дважды: что волатильность ответов LLM делает с рекомендациями казино

Повторите тот же вопрос, и список брендов изменится. Почему один скриншот ничего не доказывает и как выглядит честное измерение.

Вот эксперимент, который может провести каждый. Спросите ChatGPT про лучшее онлайн-казино в вашем рынке. Запишите бренды. Откройте новый чат и задайте тот же вопрос слово в слово. Списки пересекутся, но не совпадут. Повторите ещё несколько раз, и бренды начнут выпадать, возвращаться и меняться местами между прогонами. А теперь представьте, что стратегия строится по первому списку. Именно это на практике делает большинство команд, когда «аудирует» свою AI-видимость парой ручных промптов.

Почему так происходит

Языковые модели сэмплируют. Температура, разброс ретривала, балансировка нагрузки между версиями модели, всё это добавляет случайности в то, какие бренды попадут в итоговую фразу. Бренд может стоять первым в одном прогоне вопроса и у самого низа в следующем, хотя с самим брендом ничего не произошло. Это не баг, который вендоры скоро починят, и академические работы о волатильности генеративных движков указывают туда же. Скандал не в самой волатильности. Скандал в том, чтобы мерить сквозь неё неправильно.

Сколько стоит единичный ответ

Один ответ является одной пробой из распределения. Он может застать бренд в его лучшем прогоне или в худшем, и по скриншоту вы не отличите одно от другого. Если ваша единственная ручная проверка поймала удачный прогон, вы сдали радостный отчёт. Если неудачный, кто-то запустил ненужную пожарную тревогу. Оба отчёта одинаково уверенны и одинаково бесполезны, потому что ни один не знает, в какую точку разброса он попал.

Как выглядит честное измерение

Каждый ответ считается одной пробой и никогда истиной. Оценки в индексе FoeGlass усредняются по повторным прогонам, поэтому бренд, стабильно присутствующий в повторах, получает совсем не ту оценку, что бренд, мелькнувший в одном ответе и не вернувшийся. Отсутствие засчитывается только тогда, когда мы своими глазами видели, как движок ответил на вопрос, а вашего бренда в ответе не было. И каждое среднее остаётся связанным со своими вербатимами, так что разброс можно увидеть самому, а не верить нашей арифметике.

Практический вывод короткий. Любое утверждение об AI-видимости на основе единичных ответов, включая скриншоты, это прогноз погоды по одному взгляду в окно. Если цифре предстоит попасть в презентацию для борда, она должна быть средним по повторам с приложенным размером выборки. В этом разница между измерением и анекдотом, а анекдоты в нашей области необычайно убедительны.