Acerca de esta herramienta
La Calculadora de significación de test A/B es una herramienta gratuita en el navegador que te dice si la diferencia entre dos tasas de conversión es estadísticamente significativa o solo ruido. Introduce los visitantes y las conversiones de cada variante y ejecuta una prueba z de dos proporciones localmente: ningún dato sale de tu navegador.
Las tasas de conversión son pA = cA ÷ nA y pB = cB ÷ nB, y la mejora relativa es (pB − pA) ÷ pA × 100. La prueba agrupa los dos grupos, p = (cA + cB) ÷ (nA + nB), calcula el error estándar SE = √(p(1−p)(1/nA + 1/nB)) y la puntuación z = (pB − pA) ÷ SE. El valor p de dos colas es 2 × (1 − Φ(|z|)), donde Φ es la CDF normal construida a partir de una aproximación de la función de error (Abramowitz-Stegun 7.1.26); la confianza es (1 − valor p) × 100.
Úsala tras una prueba dividida para decidir si la variante B realmente superó a la A. La ficha de veredicto marca un resultado como significativo con una confianza del 95 % o superior. Recuerda que la significación no es lo mismo que un efecto grande o duradero: sopesa siempre también la mejora y el tamaño de la muestra.
Preguntas frecuentes
¿Qué prueba usa?
Una prueba z de dos proporciones de dos colas con un error estándar agrupado: el método estándar para comparar dos tasas de conversión. El valor p proviene de la distribución normal mediante una aproximación de la función de error (fórmula 7.1.26 de Abramowitz-Stegun), y la confianza es el 100 % menos el valor p como porcentaje.
¿Qué significa aquí una confianza del 95 %?
Significa que, si las dos variantes rindieran realmente igual, verías una diferencia así de grande o mayor solo alrededor del 5 % de las veces por azar. El veredicto indica «Significativo» con una confianza del 95 % o superior. No te dice el tamaño del efecto: para eso revisa la mejora.
¿Por qué obtengo un resultado no válido?
Las conversiones no pueden superar a los visitantes, y ambos recuentos de visitantes deben estar por encima de cero. La prueba también necesita algo de varianza: si nadie convirtió en ninguno de los grupos, o todos lo hicieron, el error estándar es cero y no puede formarse ninguna puntuación z, así que la herramienta reporta la entrada como no válida.
¿Basta la significación para declarar un ganador?
No por sí sola. Una diferencia diminuta e irrelevante puede ser significativa con una muestra enorme, mientras que un efecto real puede no alcanzar la significación con una pequeña. Considera la mejora relativa, los números absolutos y si la prueba duró lo suficiente. Todos los cálculos aquí se ejecutan de forma privada en tu navegador.
Más herramientas