Das Modell sagt jedes Mal ungefähr dasselbe. Ihre Position hier ist real und Sie können darauf planen.
Ein Lauf ist eine Anekdote. Zwanzig sind eine Messung.
Stellen Sie einem Modell dieselbe Frage zweimal und Sie können zwei verschiedene Antworten bekommen. N-Sampling führt Ihre Prompts wiederholt aus und berichtet dann, wie stark die Antworten tatsächlich schwankten, damit die Sichtbarkeitszahl, die Sie ins Meeting mitnehmen, eine ist, die Sie verteidigen können.
Modelle sind probabilistisch, Dashboards nicht
Die meisten KI-Sichtbarkeitstools führen einen Prompt einmal aus und präsentieren das Ergebnis als Tatsache. Das ist ein Münzwurf, berichtet als Münze.
Ein Sprachmodell zieht eine Stichprobe aus einer Verteilung, statt aus einem Datensatz zu lesen. Zwei identische Prompts können unterschiedliche Anbieter, unterschiedliche Zitationen und eine andere Platzierung für Sie zurückgeben. Einmal ausführen und Sie erfahren, was dieses eine Mal passiert ist, was nicht dasselbe ist wie das, was passiert.
Das zählt in beide Richtungen. Ein einzelner schlechter Lauf kann ein Team dazu bringen, Seiten neu zu schreiben, die in Ordnung waren. Ein einzelner guter Lauf kann alle überzeugen, ein Problem sei gelöst, obwohl es das nie war.
Derselbe Prompt, N-mal, dann vergleichen
Legen Sie eine Tiefe für die Marke fest, überschreiben Sie sie für die wichtigsten Prompts, und starten Sie.
- 1
Tiefe wählen
Fünf, zehn oder zwanzig Stichproben, als Markenstandard festgelegt und pro Audit überschreibbar. Die Tiefe ist eine Entscheidung zwischen Kosten und Konfidenz und bleibt Ihre.
- 2
Stichproben ausführen
Derselbe Prompt wird wiederholt gegen dasselbe Modell ausgeführt. Jede Antwort wird vollständig aufbewahrt, nicht nur ihr Wert.
- 3
Die Streuung lesen
Konsistenz, Varianzstufe, die Sichtbarkeitsspanne über die Läufe, Sentiment-Verteilung und die Halluzinationsrate über die Stichproben.
Filtern Sie abgeschlossene Audits nach Modell, nach Varianzstufe oder per Suche, sodass Sie jedes widersprüchliche Ergebnis über Ihr Prompt-Set hinweg in einer Ansicht aufrufen können.
Vier Stufen, eine davon braucht Sie
Bewertet von zehn und benannt, sodass die Liste danach sortiert, wie instabil Ihre Position ist, statt danach, wie gut der beste Lauf aussah.
Kleine Unterschiede in Formulierung und Reihenfolge, gleicher Inhalt. Normales Modellverhalten, nichts zum Nachjagen.
Die Antworten unterscheiden sich genug, um den Eindruck zu verändern, mit dem ein Käufer herausgeht. Die Stichproben zu lesen lohnt sich.
Das Modell hat inhaltlich widersprüchliche Antworten über Sie gegeben. Seine Quellen widersprechen sich und nichts ist bisher maßgeblich geworden.
Widersprüchlich ist meist ein Quellenproblem, kein Inhaltsproblem. Das Modell ist nicht über Ihre Texte verwirrt, es wägt Quellen ab, die sich widersprechen, und keine ist bisher maßgeblich geworden.
Die Streuung, nicht nur der Durchschnitt
Konsistenz und Varianz
Ein Konsistenzprozentsatz und ein Varianzwert von zehn, mit der zugehörigen Stufe. Die Kernantwort darauf, ob dieses Ergebnis stabil ist.
Sichtbarkeitsspanne
Durchschnittliche, minimale und maximale Sichtbarkeit über die Stichproben, mit der Standardabweichung. Ein Durchschnitt von 40% aus Läufen von 38 und 42 ist eine andere Geschichte als einer aus 5 und 75.
Sentiment-Verteilung
Wie sich die Stichproben auf positiv, neutral und negativ verteilen, sodass Sie sehen, ob das Modell bei Fakten oder beim Ton inkonsistent ist.
Halluzinationsrate
Der Anteil der Stichproben, die eine falsche Behauptung über Sie enthalten. Eine Halluzination in einem von zwanzig Läufen ist ein anderes Problem als eine in achtzehn.
Eine Zahl, die Sie im Meeting verteidigen können
Die erste Frage, die jemand aus der Führung zu einer KI-Sichtbarkeitszahl stellt, ist, woher Sie wissen, dass sie real ist. Sampling ist die Antwort. Es macht aus einem Wert einen Wert mit Konfidenzintervall und sagt Ihnen, welche Ihrer Prompts stabil genug zum Berichten sind und welche noch Rauschen sind.
Es schützt auch Ihre Roadmap. Einem schlechten Lauf nachzujagen ist eine der teuersten Arten, ein Content-Quartal zu verbringen, und eine Varianzstufe ist das, was es stoppt.
N-Sampling, beantwortet
Denselben Prompt mehrmals statt einmal gegen dasselbe Modell auszuführen und dann die Antworten zu vergleichen. Da Modelle probabilistisch sind, sagt Ihnen ein Lauf, was einmal passiert ist. Fünf, zehn oder zwanzig Läufe sagen Ihnen, was üblicherweise passiert, und das ist die einzige Version, die man überhaupt jemandem berichten sollte.
Sprachmodelle ziehen eine Stichprobe aus einer Verteilung, statt einen Datensatz nachzuschlagen. Zwei Läufe eines identischen Prompts können unterschiedliche Anbieter nennen, unterschiedliche Quellen zitieren und Sie unterschiedlich einordnen. Das ist normales Modellverhalten, kein Fehler, und genau deshalb kann ein Sichtbarkeitswert aus einem einzelnen Lauf in beide Richtungen in die Irre führen.
Ein Prozentsatz, der zeigt, wie eng die Stichproben miteinander übereinstimmten. Hohe Konsistenz bedeutet, Ihre Position ist stabil und Sie können darauf planen. Niedrige Konsistenz bedeutet, das Modell hat keine gefestigte Sicht auf Sie, das gute Ergebnis von heute ist also nichts, worauf man eine Prognose baut.
Konsistent, gering, mittel und widersprüchlich. Widersprüchlich ist die, auf die man reagiert: Das Modell hat über die Läufe hinweg inhaltlich widersprüchliche Antworten über Sie gegeben, was meist bedeutet, dass sich seine Quellen widersprechen und noch nichts maßgeblich geworden ist.
Fünf reichen, um offensichtliche Instabilität zu erkennen, zehn sind der praktische Standard, und zwanzig lohnen sich für Prompts, die direkt an Umsatz hängen. Sie können eine Standardtiefe für die Marke festlegen und sie pro Audit überschreiben.
Durchschnittliche, minimale und maximale Sichtbarkeit mit der Standardabweichung über die Läufe, Durchschnitt und Spanne der Erwähnungen, durchschnittliche Position, die Sentiment-Aufteilung über die Stichproben und die Halluzinationsrate: den Anteil der Stichproben, in denen eine falsche Behauptung über Sie auftauchte.
Eine Halluzination, die in einer von zwanzig Stichproben auftaucht, ist ein anderes Problem als eine, die in achtzehn auftaucht. Sampling liefert Ihnen diesen Nenner, sodass Sie einen seltenen Ausrutscher von etwas unterscheiden können, das das Modell verlässlich glaubt.
N-Sampling-Audits sind in den Tarifen Professional und Agency enthalten.
Finden Sie heraus, wie stabil Ihre KI-Sichtbarkeit wirklich ist
Starten Sie mit einem kostenlosen Sichtbarkeits-Audit und sampeln Sie dann die wichtigsten Prompts, um zu sehen, ob das Ergebnis hält.
Get a free visibility audit