Модель каждый раз говорит примерно одно и то же. Ваша позиция здесь реальна, и вы можете на неё опираться при планировании.
Один запуск — это анекдот. Двадцать — это измерение.
Задайте модели один и тот же вопрос дважды, и можете получить два разных ответа. N-сэмплирование запускает ваши запросы многократно, а затем сообщает, насколько ответы действительно различались, чтобы показатель видимости, который вы приносите на совещание, был тем, что вы можете отстоять.
Модели вероятностны, дашборды — нет
Большинство инструментов ИИ-видимости запускают запрос один раз и подают результат как факт. Это подбрасывание монеты, поданное как монета.
Языковая модель делает выборку из распределения, а не читает из записи. Два идентичных запроса могут вернуть разных поставщиков, разные цитирования и разное место для вас. Запустите один раз — и вы узнаете, что случилось в тот раз, а это не то же самое, что происходит обычно.
Это важно в обе стороны. Один плохой запуск может отправить команду переписывать страницы, с которыми всё было в порядке. Один хороший запуск может убедить всех, что проблема решена, хотя она никогда не была решена.
Тот же запрос, N раз, затем сравнение
Задайте глубину для бренда, переопределите её для самых важных запросов и запускайте.
- 1
Выберите глубину
Пять, десять или двадцать выборок, задаётся как значение по умолчанию для бренда и переопределяется для каждой проверки. Глубина — это решение между стоимостью и уверенностью, и оно остаётся за вами.
- 2
Запустите выборки
Один и тот же запрос многократно выполняется на одной и той же модели. Каждый ответ сохраняется целиком, а не только его оценка.
- 3
Прочитайте разброс
Согласованность, уровень разброса, диапазон видимости между запусками, распределение тональности и доля галлюцинаций по выборкам.
Фильтруйте завершённые проверки по модели, по уровню разброса или через поиск, чтобы вывести все противоречивые результаты по всему набору запросов в одном представлении.
Четыре уровня, один из которых требует вашего вмешательства
Оценено по десятибалльной шкале и помечено, чтобы список сортировался по тому, насколько нестабильна ваша позиция, а не по тому, насколько хорошо выглядел лучший запуск.
Небольшие различия в формулировках и порядке, суть та же. Обычное поведение модели, гнаться не за чем.
Ответы различаются достаточно, чтобы изменить впечатление, с которым уходит покупатель. Стоит прочитать выборки.
Модель дала о вас содержательно противоречивые ответы. Её источники расходятся, и ни один пока не стал авторитетным.
Противоречивость — обычно проблема источников, а не контента. Модель не путается в ваших текстах, она взвешивает источники, которые расходятся, и ни один пока не стал авторитетным.
Разброс, а не только среднее
Согласованность и разброс
Процент согласованности и оценка разброса по десятибалльной шкале с соответствующим уровнем. Главный ответ на вопрос, стабилен ли этот результат.
Диапазон видимости
Средняя, минимальная и максимальная видимость по выборкам со стандартным отклонением. Среднее 40% из запусков 38 и 42 — совсем другая история, чем построенное из 5 и 75.
Распределение тональности
Как выборки распределяются между позитивной, нейтральной и негативной, чтобы вы видели, непоследовательна ли модель в фактах или в тоне.
Доля галлюцинаций
Доля выборок, содержащих ложное утверждение о вас. Галлюцинация в одном запуске из двадцати — это другая проблема, чем в восемнадцати.
Цифра, которую можно отстоять на совещании
Первый вопрос, который любой руководитель задаёт о показателе ИИ-видимости, — откуда вы знаете, что он настоящий. Сэмплирование — это ответ. Оно превращает оценку в оценку с доверительным интервалом и говорит, какие из ваших запросов достаточно стабильны для отчёта, а какие всё ещё шум.
Оно также защищает вашу дорожную карту. Гоняться за плохим запуском — один из самых дорогих способов потратить контентный квартал, и уровень разброса — это то, что останавливает такую погоню.
N-сэмплирование: ответы
Запуск одного и того же запроса на одной и той же модели несколько раз вместо одного, с последующим сравнением ответов. Поскольку модели вероятностны, один запуск говорит, что произошло однажды. Пять, десять или двадцать запусков говорят, что происходит обычно, и это единственная версия, которую стоит кому-либо докладывать.
Языковые модели делают выборку из распределения, а не ищут запись. Два запуска идентичного запроса могут назвать разных поставщиков, процитировать разные источники и по-разному вас ранжировать. Это обычное поведение модели, а не баг, и именно поэтому оценка видимости по одному запуску может вводить в заблуждение в любую сторону.
Процент, показывающий, насколько близко выборки согласовались друг с другом. Высокая согласованность означает, что ваша позиция стабильна и на неё можно опираться при планировании. Низкая означает, что у модели нет устоявшегося взгляда на вас, поэтому сегодняшний хороший результат — не то, на чём строят прогноз.
Согласованно, незначительно, умеренно и противоречиво. Реагировать нужно на противоречивость: модель дала о вас содержательно противоречивые ответы между запусками, что обычно означает, что её источники расходятся друг с другом и ни один пока не стал авторитетным.
Пяти достаточно, чтобы уловить очевидную нестабильность, десять — практичное значение по умолчанию, а двадцать оправданы для запросов, напрямую связанных с выручкой. Можно задать глубину по умолчанию для бренда и переопределить её для каждой проверки.
Среднюю, минимальную и максимальную видимость со стандартным отклонением по запускам, среднее и диапазон упоминаний, среднюю позицию, распределение тональности по выборкам и долю галлюцинаций: долю выборок, где появилось ложное утверждение о вас.
Галлюцинация, появляющаяся в одной выборке из двадцати, — другая проблема, чем та, что появляется в восемнадцати. Сэмплирование даёт вам этот знаменатель, чтобы отличить редкий сбой от того, во что модель устойчиво верит.
Проверки с N-сэмплированием доступны в тарифах Professional и Agency.
Узнайте, насколько стабильна ваша ИИ-видимость на самом деле
Начните с бесплатного аудита видимости, затем прогоните выборки по самым важным запросам, чтобы увидеть, держится ли результат.
Get a free visibility audit