Teste A/B é uma forma de experimento controlado: unidades elegíveis são atribuídas aleatoriamente a versões diferentes e os resultados são comparados. A randomização busca equilibrar, em expectativa, fatores observados e não observados, permitindo interpretar diferença como efeito da intervenção dentro das condições do experimento.
A simplicidade visual — botão azul versus verde — esconde decisões metodológicas importantes.
A/B não é “antes e depois”
Comparar conversão de agosto com setembro não é teste A/B. Entre os períodos podem mudar campanha, sazonalidade, mix, preço e concorrência. No A/B, os grupos coexistem no mesmo horizonte e a alocação aleatória reduz confusão.
Quase-experimentos podem ser úteis quando randomização não é possível, mas exigem métodos e premissas adicionais.
Defina hipótese e efeito mínimo relevante
Uma hipótese operacional deve conectar mudança e métrica: “reduzir campos do formulário de 10 para 6 aumenta conversão sem elevar fraude ou cancelamento”. Antes do teste, defina a mínima diferença que justificaria implantação.
Sem esse limite, qualquer melhoria minúscula pode parecer interessante em amostras enormes, ou a equipe pode encerrar cedo quando encontra resultado favorável.
Unidade de randomização
Usuário, sessão, conta, loja ou região podem ser unidades. A escolha deve evitar contaminação. Se o mesmo usuário vê A e B em sessões diferentes, experiência e métricas podem se misturar. Em B2B, randomizar usuários dentro da mesma empresa pode ser inadequado se decisões são compartilhadas.
Também é importante validar sample ratio mismatch: se o plano era 50/50 e chegam 60/40 sem explicação, pode haver falha de instrumentação ou elegibilidade.
Tamanho de amostra e poder
O tamanho depende de taxa-base, efeito mínimo, nível de significância e poder desejado. Para conversões raras, detectar pequenas melhorias pode exigir grande volume. Fazer o teste com “o tráfego que temos por uma semana” não garante capacidade de responder à pergunta.
Poder baixo aumenta risco de resultado inconclusivo e estimativas instáveis. Planejamento de amostra deve acontecer antes do experimento.
Por que olhar todo dia e parar quando “deu significativo” é perigoso
Testes tradicionais assumem regra de parada definida. Ficar recalculando p e encerrar no primeiro valor abaixo de 0,05 aumenta erro tipo I. Existem métodos sequenciais próprios, mas não são equivalentes a espiar livremente.
A duração também deve cobrir ciclos relevantes: dias da semana, campanhas, frequência de recompra. Um teste de 48 horas pode não representar comportamento semanal.
Métrica primária e guardrails
Escolha uma métrica primária que represente objetivo. Métricas secundárias ajudam a explicar mecanismo; guardrails protegem contra efeitos adversos. Exemplo: primária = conversão; guardrails = fraude, cancelamento, margem e chamados.
Testar vinte métricas e destacar apenas a melhor aumenta risco de descoberta espúria. Multiplicidade precisa ser reconhecida.
Exemplo Struckel: checkout simplificado
Versão A converte 8,0%; B converte 8,5%. A diferença relativa é 6,25%. O teste encontra evidência estatística. Antes de implantar, a equipe verifica margem por pedido, chargeback e cancelamento. B converte mais, mas aumenta fraude de 0,4% para 1,1%, destruindo parte do ganho.
O resultado correto não é “B ganhou”. É comparar efeito líquido com objetivo e guardrails.
Erros frequentes
- Rodar sem hipótese prévia.
- Alterar o experimento no meio.
- Parar assim que p<0,05.
- Ignorar usuários recorrentes e contaminação.
- Usar apenas conversão e esquecer economia unitária.
- Segmentar depois e tratar qualquer subgrupo como confirmação.
- Não validar instrumentação.
- Generalizar para população diferente da testada.
Uma regra executiva melhor
Antes de dizer “funcionou”, responda: o experimento foi válido? a magnitude é relevante? o intervalo de incerteza é aceitável? guardrails ficaram saudáveis? existe mecanismo plausível? o resultado se aplica à população de decisão? o ganho compensa complexidade de manter a variante?
Teste A/B é poderoso porque troca opinião por evidência causal local. Mas continua sendo uma ferramenta dentro de um sistema de decisão, não um oráculo.
Efeitos heterogêneos: “funciona para quem?”
Um efeito médio pode esconder segmentos diferentes. Novos usuários podem responder positivamente e clientes antigos negativamente. Investigar heterogeneidade é útil, mas precisa evitar mineração posterior de dezenas de grupos até aparecer um resultado favorável.
Segmentos importantes devem ser pré-especificados quando possível. Descobertas exploratórias podem gerar novas hipóteses, que merecem validação independente.
Implementação também é parte do experimento
Depois de uma variante vencedora, rollout gradual pode revelar efeitos de escala, aprendizado e infraestrutura que o teste inicial não capturou. Um botão pode funcionar em 10% do tráfego e falhar quando muda carga do sistema ou comportamento da equipe de atendimento.
Trate implantação como continuação do aprendizado: monitore métrica primária e guardrails, compare com expectativa e esteja disposto a reverter se o sistema se comportar de modo diferente.
Significância estatística não substitui o business case
Um teste pode detectar aumento de 0,2 ponto percentual com enorme tráfego. A pergunta seguinte é econômica: quantas conversões adicionais isso representa, qual margem líquida, qual custo de manutenção da variante e qual risco operacional? Essa etapa conecta experimento ao princípio de relevância prática.
Também é útil calcular intervalo para o efeito e traduzir seus limites para dinheiro. Se a faixa plausível vai de ganho anual de R$ 20 mil a R$ 400 mil, a decisão pode depender do custo de implantação. Se toda a faixa é materialmente positiva, a confiança gerencial aumenta.
Em produto digital, pequenas diferenças podem ser relevantes em escala. O ponto não é exigir “efeito grande”, e sim definir previamente qual efeito mínimo muda a decisão.
Referências conceituais
A abordagem é consistente com princípios clássicos de experimentos randomizados e com práticas modernas de experimentação digital. Kohavi, Tang & Xu são referência importante em experimentação online confiável, especialmente em métricas, guardrails, tamanho de amostra e qualidade da plataforma experimental.
Ferramenta ajuda a executar. Método ajuda a transformar.
Se o desafio deixou de ser apenas entender um conceito e passou a envolver processo, indicadores, variabilidade, governança ou projeto de melhoria, a Struckel pode estruturar a jornada com sua equipe.