Wybierz zwycięzcę albo optymalizuj bez końca: dwa sposoby, w jakie decyduje test A/B

Każde narzędzie do testów A/B zadaje to samo pytanie: która wersja wygrała? Ale można przez to rozumieć dwie różne rzeczy, a każda wymaga innego rodzaju testu. Czasem potrzebujesz odpowiedzi — nowy projekt albo pokonuje starą stronę, albo nie, wdrażasz jedną z nich i idziesz dalej. Czasem potrzebujesz zarządcy — baner główny będzie działał cały rok, najlepsza wersja w styczniu nie jest najlepsza w lipcu, a nikt nie będzie wracał, żeby co kwartał testować go od nowa. Personyze uruchamia oba rodzaje w tej samej kampanii, a ustawienie, które wybiera między nimi, nazywa się Jak ten test decyduje. Ten artykuł wyjaśnia, co naprawdę robi każdy tryb, ile Cię kosztuje i jak wybrać.
Ten sam test rozstrzygany na dwa sposoby. Po lewej podział pozostaje stały, dopóki jedna wersja się nie sprawdzi, a potem zwycięzca przejmuje testowany ruch. Po prawej podział co noc trochę się przesuwa i nigdy nie zatrzymuje.
Dwa pytania, dwa rodzaje testu
Klasyczny test A/B to eksperyment. Ustalasz podział, czekasz, dostajesz werdykt z poziomem ufności i test się kończy. Ta uczciwość jest właśnie sednem: ponieważ podział nigdy się nie zmieniał, porównanie jest czyste i możesz każdemu pokazać, dlaczego podjąłeś taką decyzję. Ceną jest to, że przegrywająca wersja do końca dostaje pełny udział w ruchu, a werdykt jest prawdziwy tylko dla okresu, w którym test trwał.
Drugi rodzaj testu to coś, co statystycy nazywają bandytą: zamiast czekać z decyzją, stale decyduje od nowa. Każdej nocy sprawdza, co działo się ostatnio, i daje trochę więcej ruchu wersji, która teraz radzi sobie najlepiej, zawsze zostawiając część, żeby dalej się uczyć. Nigdy nie wydaje werdyktu, bo nigdy go nie potrzebuje. Ceną jest to, że podział zawsze o kilka dni nie nadąża za rzeczywistością, a porównanie nie jest na tyle czyste, by publikować je jako ustalenie. To w porządku, jeśli celem nigdy nie było ustalenie.
Wybierz zwycięzcę po osiągnięciu istotności: eksperyment
W tym trybie ruch pozostaje taki, jak go ustawiłeś, a wersje rywalizują o Twoje cele; test kończy się, gdy któraś z nich się sprawdzi. To, co znaczy „sprawdzić się”, określają cztery progi, a Personyze ustawia je surowiej niż większość narzędzi.
- Jeden lub więcej celów. Pierwszy wybrany cel jest główny; gotowość i wybór zwycięzcy opierają się na nim. Test optymalizujący kliknięcia i test optymalizujący przychód nie zawsze się zgadzają, więc wskazujesz, o który Ci chodziło.
- Ufność, sesje, czas trwania. Trzy ustawienia wstępne ustawiają wszystkie trzy naraz: Ostrożna – ufność 99%, 5000 sesji i 21 dni; Zrównoważona – 95%, 1000 sesji i 14 dni; Szybka – 90%, 500 sesji i 7 dni. Możesz też wpisać własne wartości. Minimalny czas trwania sprawia, że dobry wtorek nie wygra we wtorek.
- Minimalna poprawa. Ostrożna wymaga co najmniej 1% wzrostu, Zrównoważona 0,5%. Wersja, która prowadzi statystycznie realną, ale handlowo bez znaczenia przewagą, nie zostaje wypromowana.
- Grupa kontrolna, jeśli chcesz. Daj niezmienionej stronie własny udział — dwie wersje po 45% i 10% zatrzymane — a wzrost, który raportujesz, będzie wzrostem, który spowodowałeś, a nie wzrostem względem przypuszczenia.
Gdy próg zostanie przekroczony, zwycięzca zostaje wypromowany: cały testowany ruch, udział, który wskażesz, albo nic, jeśli wolisz dostać e-mail i zdecydować sam. Zachowana grupa kontrolna pozostaje wstrzymana, więc kampanię nadal można mierzyć po decyzji. Potem koniec — dokładnie tego od niego chciałeś.
AI: optymalizacja ciągła: zarządca
W tym trybie nic się nie kończy. Każdej nocy przebieg ocenia każdą wersję na podstawie ostatnich danych i przesuwa podział w stronę tej, która radzi sobie najlepiej teraz. Trzy cechy sprawiają, że można bezpiecznie zostawić go włączonego.
- Najwięcej waży świeży ruch. Wyświetlenia i kliknięcia tracą wagę z okresem połowicznym 28 dni, a wszystko starsze niż 84 dni odpada. Wersja, która była najlepsza dwa miesiące temu, może dziś przegrać, i o to chodzi: zauważa, kiedy zmienia się sezon.
- Przesuwa się tylko przy statystycznej pewności. Każda wersja dostaje szansę, że jest najlepsza, wyliczoną z tysięcy symulowanych powtórzeń danych. Prawie równe liczby oznaczają, że dane nie odróżniają jeszcze wersji, i wtedy podział stoi w miejscu. Poniżej kilkuset ważonych wyświetleń w ogóle niczego nie oblicza, bo bandyta na garstce sesji to generator liczb losowych z poważną miną.
- 10% zawsze eksploruje. Co noc jedna dziesiąta ruchu jest dzielona po równo między wersje, bez względu na wszystko. Przegrywająca wersja nadal zbiera dane, które mogą ją zrehabilitować, żadna wersja nigdy nie spada do zera, a przerwa w danych nie może zamrozić wersji na 100%.
Co po kolei robi nocny przebieg. Ostatni krok jako jedyny wpływa na serwowanie i zapisuje zmiany tylko wtedy, gdy zalecany podział różni się od obecnego o co najmniej trzy punkty.
Dwie kolejne reguły dotyczą szacunku dla Twoich ustawień. Wersja ustawiona przez Ciebie na 0% to Twoja decyzja, a nie punkt danych, i pozostaje na 0%; dopiero ręczne nadanie jej udziału przywraca ją do gry. A optymalizator przydziela na nowo tylko ruch, który podział już przydziela — kampania wstrzymująca 10% dla niezmienionej strony nadal je wstrzymuje.
Jedno uczciwe ograniczenie: tryb ciągły ocenia interakcję — kliknięcia lub więcej na potwierdzone wyświetlenia, przy czym kliknięcie zakończone konwersją nadal się liczy — bo to sygnał, który stale działające treści generują codziennie w dużej liczbie. Jeśli zależy Ci na przychodzie na sesję przy zmianie w checkoucie, to pytanie do eksperymentu nastawionego na ten cel.
Który wybrać?
| Wybierz zwycięzcę po osiągnięciu istotności | AI: optymalizacja ciągła | |
|---|---|---|
| Pytanie | Która wersja jest lepsza i o ile? | Która wersja powinna dostać ruch tej nocy? |
| Jak się kończy | Werdyktem. Zwycięzca zostaje wypromowany, a test się kończy. | Nie kończy się. Podział stale podąża za świeżymi danymi. |
| Ruch w trakcie działania | Pozostaje dokładnie taki, jak go ustawiłeś, więc porównanie jest uczciwe. | Co noc przesuwa się w stronę lidera; 10% zawsze dzielone po równo. |
| Co optymalizuje | Dowolny wybrany cel: zakupy, przychód na sesję, rejestracje, kliknięcia, współczynnik odrzuceń, czas na stronie. | Interakcję: kliknięcia lub więcej na potwierdzone wyświetlenia, więc liczy się też kliknięcie, które doprowadziło do zakupu. |
| Dobre do | Decyzji, którą wdrożysz raz: nowy projekt strony, układ cennika, krok checkoutu, strona przeciw stronie. | Stale działających treści, których najlepsza wersja się zmienia: banery główne, oferty, bloki sezonowe, promowane treści. |
| Koszt pomyłki | Przegrywający zachowuje pełny udział aż do decyzji, a później możesz źle odczytać nieaktualny wynik. | Krótkie opóźnienie: podział nie nadąża za rzeczywistością o dni, nigdy o tygodnie. |
| Czego możesz bronić | Ufność, sesje, czas trwania, minimalna poprawa: decyzja, którą możesz pokazać każdemu. | Szansa na bycie najlepszą dla każdej wersji, odświeżana co noc, i wynikający z niej podział. |
Reguła, która się sprawdza: jeśli wstydziłbyś się, że w następnym kwartale nadal to testujesz, wybierz zwycięzcę. Jeśli wstydziłbyś się, że przestałeś, optymalizuj w sposób ciągły. Strona cennika należy do pierwszej grupy. Baner główny na stronie głównej do drugiej. I możesz zmienić zdanie: tryb to ustawienie kampanii stosowane przy zapisie, a ta sama kampania może najpierw działać jako eksperyment, a potem zostać przekazana optymalizatorowi, gdy stanie się stałym elementem strony.
Jest też warto znać rozwiązanie pośrednie. Tryb eksperymentu ma opcję stopniowego przesuwania rotacji w stronę prawdopodobnego zwycięzcy w trakcie testu. Szybciej prowadzi do decyzji, kosztem części rygoru, dla którego warto było prowadzić eksperyment. Używaj jej w testach pilnych, a nie w tych, których będziesz musiał bronić.
Trzecie odczytanie: dla każdej grupy odbiorców
Oba tryby łączy odczyt, którego większość narzędzi w ogóle nie ma. Funkcja Odkrywanie odbiorców w Personyze przeszukuje dane odwiedzających w poszukiwaniu grup, które konwertują znacznie powyżej lub poniżej średniej, a test jest oceniany osobno w każdej z tych grup: współczynnik dla każdej wersji, która wersja tam prowadzi i z jaką pewnością.
Werdykty dla grup odbiorców w trwającym teście. Wersja może wygrać na całej stronie i przegrać wśród odwiedzających, którzy wchodzą bezpośrednio, a wiersze to pokazują, wraz z pewnością każdego werdyktu.
To zmienia pojęcie „zwycięzcy”. B wygrała ogółem, ale A wygrała wśród odwiedzających na telefonach z 86% pewnością. W narzędziu, które raportuje tylko sumę, wdrażasz B i po cichu pogarszasz doświadczenie na telefonach. Tutaj raport nazywa tę rozbieżność, a edytor kampanii pokazuje ją przy każdym teście, niezależnie od trybu decyzji.
To, co z tym zrobić, jest dziś celowo proste: kampania nadal serwuje wszystkim jeden podział, więc aby zareagować na zwycięzcę w danej grupie, targetujesz kopię kampanii na tę grupę z jej zwycięską wersją. Odkryte grupy odbiorców są kategorią w selektorze reguł kampanii, więc to kilka kliknięć. Automatyczne serwowanie innego podziału dla każdej grupy jest w planach, a ocena dla grup odbiorców będzie tym sterować.
Konfiguracja
- W kroku Treść kampanii dodaj wersje jako grupy rotacji i ustaw podział. Aby mieć grupę kontrolną, zostaw opcji Oryginał strony jej własny udział.
- Wybierz sposób przypisywania odwiedzających. Rotacja użytkowników utrzymuje odwiedzającego przy tej samej wersji podczas każdej wizyty i jest właściwym ustawieniem domyślnym; Wizyty przypisuje każdą wizytę od nowa, dla banerów i nagłówków, w których mierzy się wyświetlenie.
- W sekcji Cele wybierz jeden lub więcej celów; pierwszy jest główny.
- W sekcji Jak ten test decyduje wybierz Wybierz zwycięzcę po osiągnięciu istotności i ustawienie wstępne albo AI: optymalizacja ciągła. Zapisz.
- Wynik odczytasz w kroku Wyniki. W trybie ciągłym tabela pokazuje wyświetlenia, kliknięcia, szansę na bycie najlepszą, obecny i zalecany podział, a pod nią, która wersja wygrywa w każdej grupie odbiorców.
- Testy A/B i wielowymiarowe — strona funkcji z edytorem pokazanym krok po kroku.
- Odkrywanie odbiorców — skąd pochodzi odczyt dla grup odbiorców.
- Jak silnik personalizacji decyduje — gdzie w warstwach mieszczą się testy.
Book a demo with a personalization expert
30 minutes with a personalization expert. Bring your stack, your goals, your skepticism. We'll show you what changes when every visit feels like the only one.
