Modellen säger ungefär samma sak varje gång. Din position här är verklig och du kan planera utifrån den.
En körning är en anekdot. Tjugo är en mätning.
Ställ samma fråga till en modell två gånger och du kan få två olika svar. N-sampling kör dina prompter upprepade gånger och rapporterar sedan hur mycket svaren faktiskt varierade, så att synlighetssiffran du tar med till mötet är en du kan försvara.
Modeller är probabilistiska, dashboards är det inte
De flesta verktyg för AI-synlighet kör en prompt en gång och presenterar resultatet som ett faktum. Det är en slantsingling rapporterad som ett mynt.
En språkmodell drar ett urval ur en fördelning i stället för att läsa ur en post. Två identiska prompter kan returnera olika leverantörer, olika citeringar och en annan placering för dig. Kör en gång och du lär dig vad som hände just då, vilket inte är samma sak som vad som händer.
Det spelar roll åt båda hållen. En enda dålig körning kan skicka ett team till att skriva om sidor som var i sin ordning. En enda bra körning kan övertyga alla om att ett problem är löst fast det aldrig var det.
Samma prompt, N gånger, sedan jämför
Sätt ett djup för varumärket, åsidosätt det för de viktigaste prompterna, och kör.
- 1
Välj ett djup
Fem, tio eller tjugo urval, satt som standard för varumärket och möjligt att åsidosätta per analys. Djupet är ett val mellan kostnad och tillförlitlighet och det förblir ditt.
- 2
Kör urvalen
Samma prompt körs upprepade gånger mot samma modell. Varje svar sparas i sin helhet, inte bara dess poäng.
- 3
Läs spridningen
Konsistens, variansnivå, synlighetens spann över körningarna, sentimentfördelning och hallucinationsfrekvensen över urvalen.
Filtrera avslutade analyser på modell, på variansnivå eller via sökning, så att du kan ta fram alla motstridiga resultat i hela din promptuppsättning i en vy.
Fyra nivåer, varav en behöver dig
Poängsatt av tio och namngiven, så att listan sorteras efter hur instabil din position är snarare än efter hur bra den bästa körningen såg ut.
Små skillnader i formulering och ordning, samma innehåll. Normalt modellbeteende, inget att jaga.
Svaren skiljer sig tillräckligt för att ändra intrycket en köpare går därifrån med. Värt att läsa urvalen.
Modellen gav sakligt motstridiga svar om dig. Dess källor är oense och inget har ännu blivit tongivande.
Motstridig är oftast ett källproblem snarare än ett innehållsproblem. Modellen är inte förvirrad över din text, den väger källor som är oense, och ingen har ännu blivit tongivande.
Spridningen, inte bara medelvärdet
Konsistens och varians
En konsistensprocent och en varianspoäng av tio, med tillhörande nivå. Huvudsvaret på om resultatet är stabilt.
Synlighetsspann
Genomsnittlig, lägsta och högsta synlighet över urvalen, med standardavvikelsen. Ett snitt på 40% från körningar på 38 och 42 är en annan historia än ett byggt av 5 och 75.
Sentimentfördelning
Hur urvalen fördelar sig över positivt, neutralt och negativt, så att du ser om modellen är inkonsekvent kring fakta eller kring ton.
Hallucinationsfrekvens
Andelen urval som innehåller ett falskt påstående om dig. En hallucination i en av tjugo körningar är ett annat problem än en i arton.
En siffra du kan försvara på ett möte
Den första frågan någon i ledningen ställer om en AI-synlighetssiffra är hur du vet att den är verklig. Sampling är svaret. Det gör en poäng till en poäng med ett konfidensintervall, och det talar om vilka av dina prompter som är stabila nog att rapportera och vilka som fortfarande är brus.
Det skyddar också din roadmap. Att jaga en dålig körning är ett av de dyraste sätten att spendera ett innehållskvartal, och en variansnivå är det som stoppar det.
N-sampling, besvarat
Att köra samma prompt mot samma modell flera gånger i stället för en, och sedan jämföra svaren. Eftersom modeller är probabilistiska säger en körning vad som hände en gång. Fem, tio eller tjugo körningar säger vad som brukar hända, vilket är den enda versionen värd att rapportera till någon.
Språkmodeller drar ett urval ur en fördelning i stället för att slå upp en post. Två körningar av en identisk prompt kan nämna olika leverantörer, citera olika källor och rangordna dig olika. Det är normalt modellbeteende, inte en bugg, och det är precis därför en synlighetspoäng från en enda körning kan vilseleda åt båda hållen.
En procentsats som visar hur nära urvalen stämde överens med varandra. Hög konsistens betyder att din position är stabil och att du kan planera utifrån den. Låg konsistens betyder att modellen inte har någon fastlagd bild av dig, så dagens goda resultat är inget att bygga en prognos på.
Konsistent, liten, måttlig och motstridig. Motstridig är den att agera på: modellen gav sakligt motstridiga svar om dig mellan körningar, vilket oftast betyder att dess källor är oense med varandra och att inget ännu blivit tongivande.
Fem räcker för att fånga uppenbar instabilitet, tio är den praktiska standarden, och tjugo är värt det för prompter som är direkt knutna till intäkter. Du kan sätta ett standarddjup för varumärket och åsidosätta det per analys.
Genomsnittlig, lägsta och högsta synlighet med standardavvikelsen över körningarna, snitt och spann för omnämnanden, genomsnittlig position, sentimentfördelningen över urvalen och hallucinationsfrekvensen: andelen urval där ett falskt påstående om dig förekom.
En hallucination som dyker upp i ett urval av tjugo är ett annat problem än en som dyker upp i arton. Sampling ger dig den nämnaren, så att du kan skilja en sällsynt miss från något modellen tillförlitligt tror.
N-samplingsanalyser ingår i planerna Professional och Agency.
Ta reda på hur stabil din AI-synlighet verkligen är
Börja med en kostnadsfri synlighetsanalys, och sampla sedan de viktigaste prompterna för att se om resultatet håller.
Get a free visibility audit