MarketingEsta ferramenta roda no seu navegador. Nenhum arquivo ou texto é enviado para os nossos servidores.

Significância de teste A/B

Compare duas variantes com teste z de duas proporções e veja valor-p, intervalo de confiança e o cálculo.

Variante A (controle)

Variante B (desafiante)

Nível de confiança
Direção do teste

Testa diferença nos dois sentidos. É a escolha padrão e a mais segura.

{c.emptyState}

Visitantes e conversões de A e de B. A calculadora roda um teste z de duas proporções e mostra o valor-p, o intervalo de confiança e como chegou até eles.

Tudo é calculado no seu navegador. Nada do que você digita é enviado ou salvo.

Compartilhar ferramentaWhatsApp
Continue

Experimente outra ferramenta

Escolhidas para acompanhar esta

Calculadora gratuita de significância estatística para teste A/B. Informe visitantes e conversões de cada variante e a ferramenta roda um teste z de duas proporções, mostrando o valor-p, o escore z, o intervalo de confiança para a diferença e o cálculo passo a passo. Ela também avisa quando a amostra é pequena demais para o método ser confiável. Tudo é calculado no navegador, sem envio.

01

Como usar esta ferramenta

  1. 01Informe a variante A (controle)Quantos visitantes viram e quantos converteram. Conversão não pode ser maior que visitantes.
  2. 02Informe a variante B (desafiante)Os mesmos dois números para a versão que você está testando.
  3. 03Escolha nível e direçãoO padrão é 95% e bicaudal. A direção deve ser escolhida antes de ver os dados.
02

Quando isso é útil?

  • Decidir se um teste terminouUm valor-p acima do limite significa que ainda não dá para separar as variantes.
  • Evitar encerrar cedo demaisUma diferença grande com poucas conversões costuma ser ruído, e o teste mostra isso.
  • Documentar a decisãoO detalhamento do cálculo serve para justificar a escolha para o time.
03

Exemplos

  • 1.000 visitantes e 100 conversões contra 1.000 e 12010% contra 12%. Com esse volume, a diferença fica perto do limite de significância.
  • 100 visitantes e 10 conversões contra 100 e 12A mesma diferença percentual, mas com dez vezes menos dados: longe de ser significante.
  • Uma variante sem nenhuma conversãoA ferramenta avisa que o intervalo em torno de zero é largo e a comparação é frágil.
04

Dicas para um resultado melhor

  • Escolha a direção antes de olhar os dadosTrocar para unicaudal depois de ver que B ganhou é uma forma clássica de fabricar significância.
  • Significante não quer dizer relevanteCom tráfego suficiente, um ganho de 0,1% fica significante e mesmo assim não compensa implementar.
05

O que o valor-p realmente diz

O valor-p é a probabilidade de observar uma diferença deste tamanho, ou maior, se na verdade as duas variantes fossem idênticas. Um valor-p de 0,03 significa que uma diferença assim apareceria por acaso em cerca de 3% das vezes. O que ele NÃO diz: não é a probabilidade de B ser melhor que A, e não é a probabilidade de a sua decisão estar certa. Essa confusão é a mais comum na área, e leva a muita gente a ter mais confiança do que o dado sustenta.

06

Bicaudal ou unicaudal

O teste bicaudal pergunta se existe diferença em qualquer direção, e é o padrão e a escolha segura. O unicaudal pergunta apenas se B é melhor que A, o que torna mais fácil atingir significância — e é exatamente por isso que ele só é legítimo quando a direção foi definida antes da coleta, por uma razão de fato. Escolher unicaudal depois de ver que B está na frente é manipulação, mesmo quando não intencional: metade da chance de erro simplesmente desaparece da conta.

07

Quando o método não vale

O teste z de duas proporções depende de uma aproximação normal, que exige amostras razoáveis. A ferramenta avisa em três situações: menos de 5 conversões ou não conversões esperadas em alguma variante, menos de 100 visitantes em alguma variante, e variante sem nenhuma conversão. Nesses casos o valor-p ainda aparece, mas deve ser lido como indicativo. Há também uma armadilha que nenhuma calculadora resolve: ficar olhando o resultado todo dia e parar assim que dá significante infla muito a taxa de falso positivo. Defina o tamanho da amostra antes e respeite.

08

O intervalo de confiança importa mais que o valor-p

O intervalo mostra a faixa plausível para a diferença real entre as variantes, em pontos percentuais. Um resultado significante cujo intervalo vai de 0,1 a 4,0 pontos diz algo muito diferente de um que vai de 2,5 a 3,0: no primeiro, o ganho pode ser praticamente nulo. Decidir qual tamanho de ganho vale a pena implementar, antes de rodar o teste, evita a discussão inútil sobre um efeito estatisticamente real e praticamente irrelevante.

09

Perguntas frequentes

O que significa o valor-p?

A probabilidade de ver uma diferença deste tamanho, ou maior, se as variantes fossem iguais. Não é a probabilidade de B ser melhor.

Bicaudal ou unicaudal?

Bicaudal na dúvida. O unicaudal só é legítimo se a direção foi definida antes da coleta, nunca depois de ver quem ganhou.

Posso parar o teste assim que der significante?

Não deveria. Olhar repetidamente e parar no primeiro resultado favorável aumenta muito a chance de falso positivo. Defina a amostra antes.

Por que apareceu um aviso de amostra pequena?

Porque a aproximação normal usada pelo teste não é confiável com poucas conversões ou poucos visitantes. Trate o valor-p como indicativo.

Resultado significante quer dizer que vale implementar?

Não necessariamente. Com tráfego grande, ganhos mínimos ficam significantes. Olhe o intervalo de confiança e decida se o tamanho do efeito compensa.

Falta alguma ferramenta ou você encontrou um erro?A gente constrói o Tooleem a partir do que você precisa. Conta pra gente o que incluir ou corrigir.
Fale com a gente