Kies een winnaar, of stop nooit met optimaliseren: twee manieren waarop een A/B-test beslist

Elke A/B-testtool stelt dezelfde vraag: welke versie won? Maar daar kun je twee verschillende dingen mee bedoelen, en die vragen om twee verschillende soorten test. Soms heb je een antwoord nodig — een redesign verslaat de oude pagina of niet, je lanceert er één van en gaat door. Soms heb je een beheerder nodig — de herobanner draait het hele jaar, de beste versie in januari is niet de beste in juli, en niemand gaat hem elk kwartaal opnieuw testen. Personyze draait beide soorten vanuit dezelfde campagne, en de instelling die ertussen kiest, heet Hoe deze test beslist. Dit artikel gaat over wat elke modus echt doet, wat hij je kost en hoe je kiest.
Dezelfde test, op twee manieren beslist. Links blijft de verdeling staan tot één versie zich bewijst, waarna de winnaar het geteste verkeer krijgt. Rechts verschuift de verdeling elke nacht een beetje, en stopt nooit.
Twee vragen, twee soorten test
Een klassieke A/B-test is een experiment. Je legt de verdeling vast, je wacht, je krijgt een uitspraak met een betrouwbaarheid erbij, en de test is voorbij. Die eerlijkheid is precies het punt: omdat de verdeling nooit bewoog, is de vergelijking zuiver, en je kunt iedereen laten zien waarom je die keuze maakte. De prijs is dat de verliezende versie tot het einde haar volledige deel van het verkeer blijft krijgen, en dat de uitspraak alleen geldt voor de periode waarin de test liep.
De andere soort test is wat statistici een bandit noemen: in plaats van te wachten met beslissen, blijft hij opnieuw beslissen. Elke nacht kijkt hij naar wat er recent is gebeurd en geeft hij iets meer verkeer aan de versie die nu het best presteert, terwijl hij altijd een deel achterhoudt om te blijven leren. Hij komt nooit met een uitspraak, omdat hij die nooit nodig heeft. De prijs is dat de verdeling de werkelijkheid altijd een paar dagen achterloopt, en dat de vergelijking niet zuiver genoeg is om als bevinding te publiceren. Dat is prima als het doel nooit een bevinding was.
Kies een winnaar bij significantie: het experiment
In deze modus blijft het verkeer zoals je het instelde terwijl de versies strijden op je doelen, en de test sluit af wanneer één ervan zich bewijst. Wat “zich bewijzen” betekent, zijn vier drempels, en Personyze levert ze strenger dan de meeste tools.
- Eén of meer doelen. Het eerste doel dat je kiest, is het primaire; de gereedheid en de keuze van de winnaar volgen dat doel. Een test die optimaliseert op klikken en een test die optimaliseert op omzet zijn het niet altijd eens, dus je zegt welke je bedoelde.
- Betrouwbaarheid, sessies, looptijd. Drie voorinstellingen zetten ze alle drie tegelijk: Voorzichtig met 99% betrouwbaarheid, 5.000 sessies en 21 dagen; Gebalanceerd met 95%, 1.000 sessies en 14 dagen; Snel met 90%, 500 sessies en 7 dagen. Of vul je eigen waarden in. De minimale looptijd voorkomt dat een goede dinsdag op dinsdag wint.
- Een minimale verbetering. Voorzichtig vraagt minstens 1% lift, Gebalanceerd 0,5%. Een versie die voorligt met een statistisch echte maar commercieel zinloze marge, wordt niet gepromoveerd.
- Een controlegroep, als je die wilt. Geef de onaangeroerde site een eigen deel — twee versies op 45% en 10% achtergehouden — en de lift die je rapporteert is de lift die jij veroorzaakte, niet de lift tegenover een gok.
Wanneer de lat is gehaald, wordt de winnaar gepromoveerd: al het geteste verkeer, of het deel dat jij aanwijst, of helemaal niets als je liever een e-mail krijgt en zelf beslist. Een controlegroep die je aanhield, blijft achtergehouden, zodat de campagne na de keuze nog steeds meetbaar is. Daarna is het voorbij, en dat is precies wat je ervan wilde.
AI: doorlopend optimaliseren: de beheerder
In deze modus sluit niets af. Elke nacht beoordeelt een ronde elke versie op wat er recent is gebeurd en verdeelt de splitsing opnieuw richting de versie die nu presteert. Drie eigenschappen maken het veilig om hem te laten draaien.
- Recent verkeer telt het zwaarst. Weergaven en klikken nemen af met een halveringstijd van 28 dagen, en alles ouder dan 84 dagen valt weg. Een versie die twee maanden geleden de beste was, kan vandaag nog verliezen, en dat is precies de bedoeling: hij merkt het als een seizoen omslaat.
- Hij beweegt alleen met statistische zekerheid. Elke versie krijgt een kans dat ze de beste is, berekend uit duizenden gesimuleerde herhalingen van de data. Bijna gelijke getallen betekenen dat de data de versies nog niet kan onderscheiden, en dan blijft de verdeling staan. Hij weigert ook iets te berekenen onder een paar honderd afgenomen weergaven, want een bandit op een handvol sessies is een willekeurige-getallengenerator met een serieus gezicht.
- 10% blijft altijd verkennen. Een tiende van het verkeer wordt elke nacht gelijk over de versies verdeeld, wat er ook gebeurt. Een verliezende versie blijft de data verdienen die haar kan redden, geen enkele versie wordt ooit naar nul gedreven, en een datastoring kan geen versie op 100% bevriezen.
Wat de nachtelijke ronde doet, op volgorde. De laatste stap is de enige die de uitlevering raakt, en die schrijft alleen als de aanbevolen verdeling drie punten of meer afwijkt van de huidige.
Nog twee regels gaan over respect voor wat jij instelde. Een versie die je op 0% zet, is jouw beslissing en geen datapunt, en blijft op 0%; haar met de hand een deel geven, laat haar weer meedoen. En de optimalisatie verdeelt alleen het verkeer dat de verdeling al toewijst — een campagne die 10% achterhoudt voor de onaangeroerde site, blijft dat achterhouden.
Eén eerlijke beperking: de doorlopende modus scoort interactie — klikken of beter, gedeeld door bevestigde weergaven, waarbij een klik die tot een conversie leidde nog steeds telt — omdat dat het signaal is dat altijd-aan-content elke dag in volume oplevert. Als je om omzet per sessie bij een checkoutwijziging geeft, is dat een vraag voor het experiment, gericht op dat doel.
Welke kies je?
| Kies een winnaar bij significantie | AI: doorlopend optimaliseren | |
|---|---|---|
| De vraag | Welke versie is beter, en hoeveel? | Welke versie krijgt vannacht het verkeer? |
| Hoe het eindigt | Met een uitspraak. De winnaar wordt gepromoveerd en de test sluit af. | Het eindigt niet. De verdeling blijft de recente data volgen. |
| Verkeer tijdens de looptijd | Blijft precies zoals je het instelde, zodat de vergelijking eerlijk is. | Verschuift elke nacht richting de koploper; 10% altijd gelijk verdeeld. |
| Waarop het optimaliseert | Elk doel dat je kiest: aankopen, omzet per sessie, aanmeldingen, klikken, bouncepercentage, tijd op de site. | Interactie: klikken of beter, gedeeld door bevestigde weergaven, dus een klik die tot een aankoop leidde, telt ook. |
| Geschikt voor | Een beslissing die je één keer doorvoert: redesign, prijslay-out, checkoutstap, pagina tegen pagina. | Altijd-aan-content waarvan de beste versie verschuift: herobanners, aanbiedingen, seizoensblokken, gepromote content. |
| Kosten van ongelijk hebben | De verliezer houdt zijn volledige deel tot de keuze, en later kun je een verouderd resultaat verkeerd lezen. | Een korte vertraging: de verdeling loopt dagen achter op de werkelijkheid, nooit weken. |
| Wat je kunt verdedigen | Betrouwbaarheid, sessies, looptijd, minimale verbetering: een keuze die je iedereen kunt laten zien. | Een kans-op-beste per versie, elke nacht ververst, en de verdeling die daaruit volgt. |
Een vuistregel die standhoudt: als je je zou schamen om het volgend kwartaal nog steeds te testen, kies dan een winnaar. Als je je zou schamen om ermee gestopt te zijn, optimaliseer dan doorlopend. Een prijspagina hoort in de eerste groep. Een homepagehero hoort in de tweede. En je kunt van gedachten veranderen: de modus is een instelling op de campagne die wordt toegepast als je opslaat, en dezelfde campagne kan eerst als experiment draaien en daarna aan de optimalisatie worden overgedragen als hij meubilair is geworden.
Er is een hybride die de moeite waard is. De experimentmodus heeft een optie om de rotatie tijdens de test geleidelijk naar de waarschijnlijke winnaar te verschuiven. Die komt sneller tot een beslissing, ten koste van een deel van de nauwkeurigheid die het experiment de moeite waard maakte. Gebruik hem voor tijdgevoelige tests, niet voor tests die je moet kunnen verdedigen.
De derde lezing: per doelgroep
Beide modi delen een lezing die de meeste tools helemaal niet hebben. De Doelgroepontdekking van Personyze doorzoekt je bezoekersdata op groepen die ver boven of onder gemiddeld converteren, en de test wordt binnen elk van die doelgroepen apart gescoord: het percentage per versie, welke versie daar voorligt en hoe zeker dat is.
De uitspraken per doelgroep bij een lopende test. Een versie kan de site als geheel winnen en verliezen bij de bezoekers die direct binnenkomen, en de regels zeggen dat, met hoe zeker elke uitspraak is.
Dit verandert wat een “winnaar” is. B won in totaal, maar A won bij telefoonbezoekers met 86% zekerheid. In een tool die alleen het totaal rapporteert, lanceer je B en maak je de telefoonervaring ongemerkt slechter. Hier benoemt het rapport de onenigheid, en de campagne-editor toont die bij elke test, in welke modus hij ook beslist.
Wat je ermee doet, is vandaag bewust eenvoudig: de campagne levert nog steeds één verdeling aan iedereen, dus om op een winnaar per doelgroep te handelen, target je een kopie van de campagne op die doelgroep met haar winnende versie. Ontdekte doelgroepen zijn een categorie in de regelkiezer van de campagne, dus dat is een paar klikken. Automatisch een andere verdeling per doelgroep leveren staat op de roadmap, en de scoring per doelgroep is wat dat gaat aansturen.
Instellen
- Voeg in de stap Content van de campagne je versies toe als rotatiegroepen en stel de verdeling in. Geef Originele site een deel als je een controlegroep wilt.
- Kies hoe bezoekers worden toegewezen. Gebruikersrotatie houdt een bezoeker bij elk bezoek op dezelfde versie en is de juiste standaard; Bezoeken wijst elk bezoek opnieuw toe, voor banners en koppen waarbij de vertoning wordt gemeten.
- Onder Doelen kies je er een of meer; de eerste is de primaire.
- Onder Hoe deze test beslist kies je Kies een winnaar bij significantie en een voorinstelling, of AI: doorlopend optimaliseren. Opslaan.
- Lees het resultaat af in de stap Prestaties. In de doorlopende modus toont de tabel weergaven, geklikt, kans dat ze de beste is, de huidige verdeling en de aanbevolen verdeling; daaronder welke versie per doelgroep wint.
- A/B- en multivariate testen — de productpagina, met de editor stap voor stap.
- Doelgroepontdekking — waar de lezing per doelgroep vandaan komt.
- Hoe een personalisatie-engine beslist — waar testen staat tussen de andere lagen.
Book a demo with a personalization expert
30 minutes with a personalization expert. Bring your stack, your goals, your skepticism. We'll show you what changes when every visit feels like the only one.
