Sobre esta ferramenta
A Calculadora de Significância de Teste A/B é uma ferramenta gratuita, no navegador, que diz se a diferença entre duas taxas de conversão é estatisticamente significativa ou apenas ruído. Insira os visitantes e as conversões de cada variante e ela executa um teste z de duas proporções localmente — nenhum dado sai do seu navegador.
As taxas de conversão são pA = cA ÷ nA e pB = cB ÷ nB, e o uplift relativo é (pB − pA) ÷ pA × 100. O teste agrupa os dois grupos, p = (cA + cB) ÷ (nA + nB), calcula o erro padrão SE = √(p(1−p)(1/nA + 1/nB)) e o escore z z = (pB − pA) ÷ SE. O p-valor bicaudal é 2 × (1 − Φ(|z|)), onde Φ é a CDF normal construída a partir de uma aproximação da função de erro (Abramowitz-Stegun 7.1.26); a confiança é (1 − p-valor) × 100.
Use-a após um teste dividido para decidir se a variante B realmente superou a A. O bloco de veredito marca um resultado como significativo com 95% de confiança ou mais. Lembre-se de que significância não é o mesmo que um efeito grande ou duradouro — sempre pondere também o uplift e o tamanho da amostra.
Perguntas frequentes
Que teste isto usa?
Um teste z de duas proporções, bicaudal, com erro padrão agrupado — o método padrão para comparar duas taxas de conversão. O p-valor vem da distribuição normal por meio de uma aproximação da função de erro (fórmula 7.1.26 de Abramowitz-Stegun), e a confiança é 100% menos o p-valor como porcentagem.
O que significa 95% de confiança aqui?
Significa que, se as duas variantes tivessem realmente o mesmo desempenho, você veria uma diferença deste tamanho ou maior apenas cerca de 5% das vezes por acaso. O veredito diz 'Significativo' com 95% de confiança ou mais. Ele não informa o tamanho do efeito — verifique o uplift para isso.
Por que recebo um resultado inválido?
As conversões não podem exceder os visitantes, e ambas as contagens de visitantes devem ser acima de zero. O teste também precisa de alguma variância: se ninguém converteu em nenhum grupo, ou todos converteram, o erro padrão é zero e nenhum escore z pode ser formado, então a ferramenta reporta a entrada como inválida.
A significância é suficiente para declarar um vencedor?
Não por si só. Uma diferença minúscula e sem importância pode ser significativa com uma amostra enorme, enquanto um efeito real pode não atingir significância com uma amostra pequena. Considere o uplift relativo, os números absolutos e se o teste rodou tempo suficiente. Todos os cálculos aqui rodam de forma privada no seu navegador.
Mais ferramentas