Significância de teste A/B
Compare duas variantes com teste z de duas proporções e veja valor-p, intervalo de confiança e o cálculo.
Variante A (controle)
Variante B (desafiante)
{c.emptyState}
Visitantes e conversões de A e de B. A calculadora roda um teste z de duas proporções e mostra o valor-p, o intervalo de confiança e como chegou até eles.
Tudo é calculado no seu navegador. Nada do que você digita é enviado ou salvo.
Experimente outra ferramenta
Escolhidas para acompanhar estaCalculadora gratuita de significância estatística para teste A/B. Informe visitantes e conversões de cada variante e a ferramenta roda um teste z de duas proporções, mostrando o valor-p, o escore z, o intervalo de confiança para a diferença e o cálculo passo a passo. Ela também avisa quando a amostra é pequena demais para o método ser confiável. Tudo é calculado no navegador, sem envio.
Como usar esta ferramenta
- 01Informe a variante A (controle)Quantos visitantes viram e quantos converteram. Conversão não pode ser maior que visitantes.
- 02Informe a variante B (desafiante)Os mesmos dois números para a versão que você está testando.
- 03Escolha nível e direçãoO padrão é 95% e bicaudal. A direção deve ser escolhida antes de ver os dados.
Quando isso é útil?
- Decidir se um teste terminouUm valor-p acima do limite significa que ainda não dá para separar as variantes.
- Evitar encerrar cedo demaisUma diferença grande com poucas conversões costuma ser ruído, e o teste mostra isso.
- Documentar a decisãoO detalhamento do cálculo serve para justificar a escolha para o time.
Exemplos
- 1.000 visitantes e 100 conversões contra 1.000 e 12010% contra 12%. Com esse volume, a diferença fica perto do limite de significância.
- 100 visitantes e 10 conversões contra 100 e 12A mesma diferença percentual, mas com dez vezes menos dados: longe de ser significante.
- Uma variante sem nenhuma conversãoA ferramenta avisa que o intervalo em torno de zero é largo e a comparação é frágil.
Dicas para um resultado melhor
- Escolha a direção antes de olhar os dadosTrocar para unicaudal depois de ver que B ganhou é uma forma clássica de fabricar significância.
- Significante não quer dizer relevanteCom tráfego suficiente, um ganho de 0,1% fica significante e mesmo assim não compensa implementar.
O que o valor-p realmente diz
O valor-p é a probabilidade de observar uma diferença deste tamanho, ou maior, se na verdade as duas variantes fossem idênticas. Um valor-p de 0,03 significa que uma diferença assim apareceria por acaso em cerca de 3% das vezes. O que ele NÃO diz: não é a probabilidade de B ser melhor que A, e não é a probabilidade de a sua decisão estar certa. Essa confusão é a mais comum na área, e leva a muita gente a ter mais confiança do que o dado sustenta.
Bicaudal ou unicaudal
O teste bicaudal pergunta se existe diferença em qualquer direção, e é o padrão e a escolha segura. O unicaudal pergunta apenas se B é melhor que A, o que torna mais fácil atingir significância — e é exatamente por isso que ele só é legítimo quando a direção foi definida antes da coleta, por uma razão de fato. Escolher unicaudal depois de ver que B está na frente é manipulação, mesmo quando não intencional: metade da chance de erro simplesmente desaparece da conta.
Quando o método não vale
O teste z de duas proporções depende de uma aproximação normal, que exige amostras razoáveis. A ferramenta avisa em três situações: menos de 5 conversões ou não conversões esperadas em alguma variante, menos de 100 visitantes em alguma variante, e variante sem nenhuma conversão. Nesses casos o valor-p ainda aparece, mas deve ser lido como indicativo. Há também uma armadilha que nenhuma calculadora resolve: ficar olhando o resultado todo dia e parar assim que dá significante infla muito a taxa de falso positivo. Defina o tamanho da amostra antes e respeite.
O intervalo de confiança importa mais que o valor-p
O intervalo mostra a faixa plausível para a diferença real entre as variantes, em pontos percentuais. Um resultado significante cujo intervalo vai de 0,1 a 4,0 pontos diz algo muito diferente de um que vai de 2,5 a 3,0: no primeiro, o ganho pode ser praticamente nulo. Decidir qual tamanho de ganho vale a pena implementar, antes de rodar o teste, evita a discussão inútil sobre um efeito estatisticamente real e praticamente irrelevante.
Perguntas frequentes
O que significa o valor-p?
A probabilidade de ver uma diferença deste tamanho, ou maior, se as variantes fossem iguais. Não é a probabilidade de B ser melhor.
Bicaudal ou unicaudal?
Bicaudal na dúvida. O unicaudal só é legítimo se a direção foi definida antes da coleta, nunca depois de ver quem ganhou.
Posso parar o teste assim que der significante?
Não deveria. Olhar repetidamente e parar no primeiro resultado favorável aumenta muito a chance de falso positivo. Defina a amostra antes.
Por que apareceu um aviso de amostra pequena?
Porque a aproximação normal usada pelo teste não é confiável com poucas conversões ou poucos visitantes. Trate o valor-p como indicativo.
Resultado significante quer dizer que vale implementar?
Não necessariamente. Com tráfego grande, ganhos mínimos ficam significantes. Olhe o intervalo de confiança e decida se o tamanho do efeito compensa.

