Escolher um vencedor ou nunca parar de otimizar: duas formas de um teste A/B decidir

Toda ferramenta de teste A/B faz a mesma pergunta: qual versão venceu? Mas essa pergunta pode querer dizer duas coisas diferentes, e cada uma pede um tipo de teste. Às vezes você precisa de uma resposta — um redesign ganha da página antiga ou não, você publica uma delas e segue em frente. Às vezes você precisa de um gestor — o banner principal vai rodar o ano todo, a melhor versão em janeiro não é a melhor em julho, e ninguém vai voltar para testar de novo a cada trimestre. Personyze roda os dois tipos a partir da mesma campanha, e a configuração que escolhe entre eles se chama Como este teste decide. Este artigo explica o que cada modo realmente faz, quanto ele custa e como escolher.
O mesmo teste, decidido de duas formas. À esquerda, a divisão fica parada até uma versão se provar, e então a vencedora fica com o tráfego testado. À direita, a divisão se move um pouco toda noite e nunca para.
Duas perguntas, dois tipos de teste
Um teste A/B clássico é um experimento. Você fixa a divisão, espera, recebe um veredito com nível de confiança e o teste acaba. Essa justiça é justamente o ponto: como a divisão nunca se moveu, a comparação é limpa, e você pode mostrar a qualquer pessoa por que tomou aquela decisão. O preço é que a versão perdedora continua recebendo toda a sua parte do tráfego até o fim, e que o veredito só vale para o período em que o teste rodou.
O outro tipo de teste é o que os estatísticos chamam de bandit: em vez de esperar para decidir, ele fica decidindo de novo. Toda noite ele olha o que aconteceu recentemente e dá um pouco mais de tráfego à versão que está performando melhor agora, sempre reservando uma parte para continuar aprendendo. Ele nunca dá um veredito, porque nunca precisa. O preço é que a divisão está sempre alguns dias atrás da realidade, e a comparação não é limpa o suficiente para ser publicada como descoberta. Tudo bem, se o objetivo nunca foi uma descoberta.
Escolher um vencedor por significância: o experimento
Nesse modo, o tráfego fica como você configurou enquanto as versões competem nas suas metas, e o teste é concluído quando uma delas se prova. O que “se provar” significa são quatro limites, e a Personyze os entrega mais rígidos do que a maioria das ferramentas.
- Uma ou mais metas. A primeira meta escolhida é a principal; a prontidão e a escolha do vencedor seguem essa meta. Um teste que otimiza cliques e um teste que otimiza receita nem sempre concordam, então você diz qual queria.
- Confiança, sessões, duração. Três predefinições ajustam os três de uma vez: Cauteloso com 99% de confiança, 5.000 sessões e 21 dias; Equilibrado com 95%, 1.000 sessões e 14 dias; Rápido com 90%, 500 sessões e 7 dias. Ou digite os seus próprios valores. A duração mínima é o que impede uma boa terça-feira de vencer numa terça-feira.
- Uma melhoria mínima. Cauteloso pede pelo menos 1% de lift; Equilibrado, 0,5%. Uma versão que está à frente por uma margem estatisticamente real, mas comercialmente irrelevante, não é promovida.
- Um grupo de controle, se você quiser. Dê ao site sem alterações a sua própria parte — duas versões com 45% e 10% reservados — e o lift que você reporta é o lift que você causou, e não o lift contra um palpite.
Quando a barra é superada, a vencedora é promovida: todo o tráfego testado, a parte que você indicar, ou nada, se preferir receber um e-mail e decidir você mesmo. Um grupo de controle que você manteve continua reservado, para que a campanha ainda possa ser medida depois da decisão. Então acaba, que é exatamente o que você queria.
IA: otimizar continuamente: o gestor
Nesse modo nada é concluído. Toda noite uma rodada pontua cada versão pelo que aconteceu recentemente e rebalanceia a divisão em direção à que está performando agora. Três propriedades tornam seguro deixá-lo rodando.
- O tráfego recente conta mais. Visualizações e cliques perdem peso com meia-vida de 28 dias, e tudo com mais de 84 dias é descartado. Uma versão que era a melhor dois meses atrás ainda pode perder hoje, e essa é a ideia: ele percebe quando a estação muda.
- Ele só se move com confiança estatística. Cada versão recebe uma probabilidade de ser a melhor, calculada a partir de milhares de repetições simuladas dos dados. Números quase iguais significam que os dados ainda não conseguem distinguir as versões, e aí a divisão fica parada. Ele também se recusa a calcular qualquer coisa abaixo de algumas centenas de visualizações ponderadas, porque um bandit com um punhado de sessões é um gerador de números aleatórios com cara séria.
- 10% sempre explorando. Um décimo do tráfego é dividido igualmente entre as versões toda noite, aconteça o que acontecer. Uma versão perdedora continua obtendo os dados que poderiam redimi-la, nenhuma versão é levada a zero e uma falha de dados não consegue congelar uma versão em 100%.
O que a rodada noturna faz, em ordem. A última etapa é a única que mexe na entrega, e ela só grava quando a divisão recomendada difere da atual em três pontos ou mais.
Mais duas regras são sobre respeitar o que você configurou. Uma versão que você deixou em 0% é decisão sua, não um dado, e fica em 0%; dar a ela uma parte manualmente é o que a traz de volta. E o otimizador só realoca o tráfego que a divisão já atribui — uma campanha que reserva 10% para o site sem alterações continua reservando.
Um limite honesto: o modo contínuo pontua a interação — cliques ou mais sobre visualizações confirmadas, em que um clique que levou a uma conversão continua contando — porque esse é o sinal que o conteúdo sempre ativo produz em volume, todos os dias. Se o que importa para você é a receita por sessão numa mudança do checkout, essa é uma pergunta para o experimento, apontado para essa meta.
Qual você deve escolher?
| Escolher um vencedor por significância | IA: otimizar continuamente | |
|---|---|---|
| A pergunta | Qual versão é melhor, e por quanto? | Qual versão deve receber o tráfego hoje à noite? |
| Como termina | Com um veredito. A vencedora é promovida e o teste é concluído. | Não termina. A divisão continua seguindo os dados recentes. |
| Tráfego enquanto roda | Fica exatamente como você configurou, para que a comparação seja justa. | Muda toda noite em direção à líder; 10% sempre divididos igualmente. |
| O que otimiza | Qualquer meta que você escolher: compras, receita por sessão, cadastros, cliques, taxa de rejeição, tempo no site. | Interação: cliques ou mais sobre visualizações confirmadas, então um clique que levou a uma compra também conta. |
| Indicado para | Uma decisão que você publicará uma vez: redesign, layout de preços, etapa do checkout, página contra página. | Conteúdo sempre ativo cuja melhor versão muda: banners principais, ofertas, blocos sazonais, conteúdo promovido. |
| Custo de errar | A perdedora mantém toda a sua parte até a decisão, e depois você pode interpretar mal um resultado desatualizado. | Um pequeno atraso: a divisão fica dias atrás da realidade, nunca semanas. |
| O que você consegue defender | Confiança, sessões, duração, melhoria mínima: uma decisão que você pode mostrar a qualquer pessoa. | Uma probabilidade de ser a melhor por versão, atualizada toda noite, e a divisão que decorre dela. |
Uma regra prática que se sustenta: se você ficaria constrangido de ainda estar testando no próximo trimestre, escolha um vencedor. Se ficaria constrangido de ter parado, otimize continuamente. Uma página de preços pertence ao primeiro grupo. Um banner principal da home pertence ao segundo. E você pode mudar de ideia: o modo é uma configuração da campanha, aplicada quando você salva, e a mesma campanha pode rodar primeiro como experimento e depois ser entregue ao otimizador quando já virou parte da mobília.
Existe um meio-termo que vale conhecer. O modo experimento tem uma opção para deslocar gradualmente a rotação em direção à provável vencedora enquanto o teste roda. Ele chega mais rápido a uma decisão, ao custo de parte do rigor que fazia o experimento valer a pena. Use-o em testes urgentes, não nos que você vai precisar defender.
A terceira leitura: por público
Os dois modos compartilham uma leitura que a maioria das ferramentas simplesmente não tem. A Descoberta de públicos da Personyze vasculha os dados dos seus visitantes em busca dos grupos que convertem muito acima ou abaixo da média, e o teste é pontuado separadamente dentro de cada um desses públicos: a taxa por versão, qual versão lidera ali e com que certeza.
Os veredictos por público de um teste em andamento. Uma versão pode vencer no site como um todo e perder entre os visitantes que chegam direto, e as linhas mostram isso, com o grau de certeza de cada decisão.
Isso muda o que é um “vencedor”. B venceu no total, mas A venceu entre os visitantes de celular com 86% de certeza. Numa ferramenta que só reporta o total, você publica B e piora em silêncio a experiência no celular. Aqui o relatório aponta a divergência, e o editor de campanhas a mostra em todo teste, qualquer que seja o modo de decisão.
O que fazer a respeito é propositalmente simples hoje: a campanha ainda serve uma única divisão para todos, então, para agir sobre um vencedor por público, você segmenta uma cópia da campanha para aquele público com a versão vencedora. Os públicos descobertos são uma categoria no seletor de regras da campanha, então são poucos cliques. Servir automaticamente uma divisão diferente por público está no roadmap, e a pontuação por público é o que vai conduzir isso.
Configuração
- Na etapa Conteúdo da campanha, adicione as suas versões como grupos de rotação e defina a divisão. Deixe para o Site original uma parte se quiser um grupo de controle.
- Escolha como os visitantes são atribuídos. Alternar usuários mantém o visitante na mesma versão a cada visita e é o padrão certo; Visitas reatribui cada visita, para banners e títulos em que o que se mede é a impressão.
- Em Objetivos, escolha uma ou mais; a primeira é a principal.
- Em Como este teste decide, escolha Escolher um vencedor por significância e uma predefinição, ou IA: otimizar continuamente. Salve.
- Veja o resultado na etapa Desempenho. No modo contínuo, a tabela mostra visualizações, cliques, probabilidade de ser a melhor, a divisão atual e a recomendada; abaixo dela, qual versão vence por público.
- Testes A/B e multivariados — a página do recurso, com o editor mostrado passo a passo.
- Descoberta de públicos — de onde vem a leitura por público.
- Como um mecanismo de personalização decide — onde os testes ficam entre as outras camadas.
Book a demo with a personalization expert
30 minutes with a personalization expert. Bring your stack, your goals, your skepticism. We'll show you what changes when every visit feels like the only one.
