Scegliere un vincitore o non smettere mai di ottimizzare: due modi in cui un test A/B può decidere

Ogni strumento di A/B testing pone la stessa domanda: quale versione ha vinto? Ma con questa domanda si possono intendere due cose diverse, che richiedono due tipi di test diversi. A volte ti serve una risposta — un redesign batte la vecchia pagina oppure no, ne pubblicherai una e andrai avanti. A volte ti serve un gestore — il banner principale resterà attivo tutto l’anno, la versione migliore a gennaio non è la migliore a luglio, e nessuno tornerà a ritestarlo ogni trimestre. Personyze esegue entrambi i tipi dalla stessa campagna, e l’impostazione che sceglie tra i due si chiama Come decide questo test. Questo articolo spiega cosa fa davvero ciascuna modalità, quanto ti costa e come scegliere.
Lo stesso test, deciso in due modi. A sinistra la suddivisione resta ferma finché una versione non si dimostra migliore, poi il vincitore prende il traffico testato. A destra la suddivisione si sposta un po’ ogni notte e non si ferma mai.
Due domande, due tipi di test
Un classico test A/B è un esperimento. Fissi la suddivisione, aspetti, ottieni un verdetto con il suo livello di confidenza e il test finisce. Quell’equità è proprio il punto: poiché la suddivisione non si è mai spostata, il confronto è pulito e puoi mostrare a chiunque perché hai deciso così. Il prezzo è che la versione perdente continua a ricevere tutta la sua quota di traffico fino alla fine, e che il verdetto vale solo per il periodo in cui il test è stato attivo.
L’altro tipo di test è quello che gli statistici chiamano bandit: invece di aspettare per decidere, continua a decidere di nuovo. Ogni notte guarda cosa è successo di recente e dà un po’ più di traffico alla versione che sta rendendo meglio in quel momento, tenendo sempre da parte una quota per continuare a imparare. Non emette mai un verdetto, perché non ne ha mai bisogno. Il prezzo è che la suddivisione è sempre qualche giorno indietro rispetto alla realtà, e che il confronto non è abbastanza pulito da pubblicarlo come risultato. Va benissimo se l’obiettivo non è mai stato un risultato.
Scegli un vincitore alla significatività: l’esperimento
In questa modalità il traffico resta come l’hai impostato mentre le versioni competono sui tuoi obiettivi, e il test si conclude quando una di esse si dimostra migliore. Cosa significhi “dimostrarsi migliore” è definito da quattro soglie, e Personyze le imposta più severe della maggior parte degli strumenti.
- Uno o più obiettivi. Il primo obiettivo che scegli è quello principale; lo stato di preparazione e la scelta del vincitore seguono quello. Un test che ottimizza i clic e uno che ottimizza i ricavi non sempre concordano, quindi indichi quale intendevi.
- Confidenza, sessioni, durata. Tre preimpostazioni fissano tutte e tre le cose insieme: Prudente con confidenza al 99%, 5.000 sessioni e 21 giorni; Equilibrato al 95%, 1.000 sessioni e 14 giorni; Rapido al 90%, 500 sessioni e 7 giorni. Oppure inserisci valori tuoi. La durata minima è ciò che impedisce a un buon martedì di vincere di martedì.
- Un miglioramento minimo. Prudente chiede almeno l’1% di lift, Equilibrato lo 0,5%. Una versione in vantaggio di un margine statisticamente reale ma commercialmente irrilevante non viene promossa.
- Un gruppo di controllo, se lo vuoi. Dai al sito originale una sua quota — due versioni al 45% e il 10% tenuto da parte — e il lift che riporti è quello che hai causato tu, non il lift rispetto a un’ipotesi.
Quando la soglia viene superata, il vincitore viene promosso: tutto il traffico testato, la quota che indichi tu, oppure niente, se preferisci ricevere un’email e decidere da solo. Un gruppo di controllo che hai mantenuto resta da parte, così la campagna può essere misurata anche dopo la decisione. Poi è finita, ed è esattamente ciò che volevi.
IA: ottimizza di continuo: il gestore
In questa modalità nulla si conclude. Ogni notte un passaggio assegna un punteggio a ogni versione in base a ciò che è successo di recente e ribilancia la suddivisione verso quella che rende meglio adesso. Tre proprietà rendono sicuro lasciarla attiva.
- Il traffico recente conta di più. Visualizzazioni e clic perdono peso con un tempo di dimezzamento di 28 giorni, e tutto ciò che è più vecchio di 84 giorni viene scartato. Una versione che era la migliore due mesi fa può comunque perdere oggi, ed è proprio questo il punto: si accorge quando cambia la stagione.
- Si sposta solo con confidenza statistica. Ogni versione riceve una probabilità che sia la migliore, calcolata da migliaia di ripetizioni simulate dei dati. Numeri quasi uguali significano che i dati non riescono ancora a distinguere le versioni, e allora la suddivisione resta ferma. Si rifiuta anche di calcolare qualsiasi cosa sotto qualche centinaio di visualizzazioni pesate, perché un bandit su una manciata di sessioni è un generatore di numeri casuali con l’aria seria.
- Il 10% esplora sempre. Un decimo del traffico viene suddiviso in parti uguali tra le versioni ogni notte, qualunque cosa accada. Una versione perdente continua a guadagnare i dati che potrebbero riscattarla, nessuna versione viene mai portata a zero e un’interruzione dei dati non può congelare una versione al 100%.
Cosa fa il passaggio notturno, nell’ordine. L’ultimo passaggio è l’unico che tocca la distribuzione, e scrive solo quando la suddivisione consigliata differisce da quella attuale di almeno tre punti.
Altre due regole servono a rispettare ciò che hai impostato. Una versione che metti allo 0% è una tua decisione, non un dato, e resta allo 0%; darle una quota a mano è ciò che la fa rientrare. E l’ottimizzatore riassegna solo il traffico che la suddivisione già assegna — una campagna che tiene da parte il 10% per il sito originale continua a tenerlo da parte.
Un limite onesto: la modalità continua valuta l’interazione — clic o meglio sulle visualizzazioni confermate, dove un clic che ha portato a una conversione conta comunque — perché è il segnale che i contenuti sempre attivi producono in volume, ogni giorno. Se ti interessano i ricavi per sessione su una modifica del checkout, quella è una domanda per l’esperimento, puntato su quell’obiettivo.
Quale scegliere?
| Scegli un vincitore alla significatività | IA: ottimizza di continuo | |
|---|---|---|
| La domanda | Quale versione è migliore, e di quanto? | Quale versione deve ricevere il traffico stanotte? |
| Come finisce | Con un verdetto. Il vincitore viene promosso e il test si conclude. | Non finisce. La suddivisione continua a seguire i dati recenti. |
| Il traffico mentre è attivo | Resta esattamente come l’hai impostato, così il confronto è equo. | Si sposta ogni notte verso chi è in testa; il 10% sempre diviso in parti uguali. |
| Cosa ottimizza | Qualsiasi obiettivo tu scelga: acquisti, ricavi per sessione, iscrizioni, clic, frequenza di rimbalzo, tempo sul sito. | L’interazione: clic o meglio sulle visualizzazioni confermate, quindi conta anche un clic che ha portato a un acquisto. |
| Adatto per | Una decisione che pubblicherai una volta: redesign, layout dei prezzi, passaggio del checkout, pagina contro pagina. | Contenuti sempre attivi la cui versione migliore cambia nel tempo: banner principali, offerte, blocchi stagionali, contenuti promossi. |
| Il costo di sbagliare | La perdente mantiene tutta la sua quota fino alla decisione, e in seguito puoi interpretare male un risultato ormai superato. | Un breve ritardo: la suddivisione segue la realtà con qualche giorno di scarto, mai settimane. |
| Cosa puoi difendere | Confidenza, sessioni, durata, miglioramento minimo: una decisione che puoi mostrare a chiunque. | Una probabilità di essere la migliore per ogni versione, aggiornata ogni notte, e la suddivisione che ne deriva. |
Una regola pratica che ha retto: se ti imbarazzerebbe starlo ancora testando il prossimo trimestre, scegli un vincitore. Se ti imbarazzerebbe aver smesso, ottimizza di continuo. Una pagina prezzi appartiene al primo gruppo. Il banner principale della homepage al secondo. E puoi cambiare idea: la modalità è un’impostazione della campagna, applicata quando salvi, e la stessa campagna può partire come esperimento ed essere poi affidata all’ottimizzatore quando è diventata parte dell’arredamento.
C’è una via di mezzo che vale la pena conoscere. La modalità esperimento ha un’opzione per spostare gradualmente la rotazione verso il probabile vincitore mentre il test è in corso. Arriva prima a una decisione, a scapito di parte del rigore che rendeva utile l’esperimento. Usala per i test urgenti, non per quelli che dovrai difendere.
La terza lettura: per pubblico
Entrambe le modalità condividono una lettura che la maggior parte degli strumenti non ha affatto. La Scoperta dei pubblici di Personyze analizza i dati dei tuoi visitatori alla ricerca dei gruppi che convertono molto sopra o sotto la media, e il test viene valutato separatamente all’interno di ciascuno di quei pubblici: il tasso per versione, quale versione è in testa lì e con quanta certezza.
I verdetti per pubblico di un test in corso. Una versione può vincere sul sito nel suo complesso e perdere con i visitatori che arrivano direttamente, e le righe lo dicono, con la certezza di ciascun verdetto.
Questo cambia cosa sia un “vincitore”. B ha vinto nel totale, ma A ha vinto tra i visitatori da telefono con l’86% di certezza. In uno strumento che riporta solo il totale, pubblichi B e peggiori in silenzio l’esperienza da telefono. Qui il report nomina il disaccordo, e l’editor della campagna lo mostra su ogni test, in qualunque modalità decida.
Cosa farne è volutamente semplice oggi: la campagna serve ancora un’unica suddivisione a tutti, quindi per agire su un vincitore per pubblico punti una copia della campagna su quel pubblico con la sua versione vincente. I pubblici scoperti sono una categoria nel selettore delle regole della campagna, quindi bastano pochi clic. Servire automaticamente una suddivisione diversa per pubblico è nella roadmap, e la valutazione per pubblico è ciò che la guiderà.
Configurazione
- Nel passaggio Contenuto della campagna, aggiungi le versioni come gruppi di rotazione e imposta la suddivisione. Lascia al Sito originale una quota se vuoi un gruppo di controllo.
- Scegli come vengono assegnati i visitatori. Rotazione degli utenti mantiene un visitatore sulla stessa versione a ogni visita ed è l’impostazione predefinita giusta; Visite riassegna ogni visita, per banner e titoli in cui si misura l’impression.
- In Obiettivi, scegli uno o più obiettivi; il primo è quello principale.
- In Come decide questo test, scegli Scegli un vincitore alla significatività e una preimpostazione, oppure IA: ottimizza di continuo. Salva.
- Leggi il risultato nel passaggio Prestazioni. Nella modalità continua la tabella mostra visualizzazioni, clic, probabilità che sia la migliore, la suddivisione attuale e quella consigliata; sotto, quale versione vince per ogni pubblico.
- A/B testing e test multivariati — la pagina della funzionalità, con l’editor mostrato passo per passo.
- Scoperta dei pubblici — da dove arriva la lettura per pubblico.
- Come decide un motore di personalizzazione — dove si colloca il testing tra gli altri livelli.
Book a demo with a personalization expert
30 minutes with a personalization expert. Bring your stack, your goals, your skepticism. We'll show you what changes when every visit feels like the only one.
