Tooleem
MarketingEsta herramienta funciona en tu navegador. No se envían archivos ni texto a nuestros servidores.

Calculadora de significancia de test A/B

Comprueba si la diferencia entre dos variantes es estadísticamente significativa. Prueba z para dos proporciones, con valor p, intervalo de confianza y el método a la vista.

Variante A (control)

Variante B (retadora)

Nivel de confianza
Tipo de prueba

Comprueba si hay diferencia en cualquiera de los dos sentidos. Es la opción estándar y la más prudente.

{c.emptyState}

Visitas y conversiones de A y de B. La calculadora aplica una prueba z para dos proporciones y muestra el valor p, el intervalo de confianza y cómo ha llegado a ellos.

Todo se calcula en tu navegador. Nada de lo que escribes se sube ni se guarda.

Compartir herramientaWhatsApp
Sigue

Prueba otra herramienta

Elegidas para acompañar a esta

Comprueba si la diferencia entre dos variantes de un test A/B es estadísticamente significativa o si entra dentro de lo que produce el azar. Escribes las visitas y las conversiones de A y de B, y la calculadora aplica una prueba z para dos proporciones y devuelve el valor p, el estadístico z y el intervalo de confianza para la diferencia. Enseña además cómo ha llegado a cada número, porque una "puntuación de significancia" que nadie puede comprobar no sirve para decidir nada. Avisa cuando la muestra es demasiado pequeña para que la prueba sea fiable. Todo se calcula en tu navegador.

01

Cómo usar esta herramienta

  1. 01Escribe los datos de las dos variantesLas visitas y las conversiones de A (el control) y de B (la retadora). Son recuentos, así que van en números enteros.
  2. 02Elige el nivel de confianza y el tipo de pruebaEl 95 % es lo habitual. Bilateral comprueba si hay diferencia en cualquier sentido; unilateral solo si B supera a A, y esa elección hay que hacerla antes de ver los datos.
  3. 03Lee el resultado y los avisosAdemás del veredicto, mira el intervalo de confianza y cualquier aviso sobre el tamaño de la muestra antes de decidir.
02

¿Cuándo es útil?

  • Decidir si una variante gana de verdadUn 3,1 % frente a un 2,8 % puede ser una mejora real o ruido, y la diferencia depende del número de visitas.
  • Saber si hace falta seguir midiendoSi el resultado no es significativo, normalmente significa que todavía no hay datos suficientes, no que las variantes sean iguales.
  • Documentar una decisiónEl desglose del método deja por escrito con qué números y con qué criterio se tomó la decisión.
03

Ejemplos

  • Diferencia clara5.000 visitas y 150 conversiones en A frente a 5.000 y 200 en B: del 3 % al 4 %, con un valor p muy por debajo de 0,05. Significativo al 95 %.
  • La misma diferencia con poca muestra500 visitas y 15 conversiones frente a 500 y 20: las mismas tasas del 3 % y el 4 %, pero el valor p ya no baja de 0,05. La diferencia es idéntica; lo que falta son datos.
  • Aviso por muestra pequeñaCon menos de 100 visitas en una variante, o con menos de 5 conversiones esperadas, la herramienta avisa de que la aproximación normal no es fiable ahí.
04

Consejos para un mejor resultado

  • Elige el tipo de prueba antes de mirarCambiar a unilateral después de ver que B va ganando duplica artificialmente tus probabilidades de encontrar un resultado significativo.
  • No pares el test al ver el primer resultado buenoComprobar la significancia todos los días y parar en cuanto sale bien infla muchísimo los falsos positivos. Fija el tamaño de muestra antes de empezar.
05

El método, explicado entero

Se aplica una prueba z para dos proporciones. Bajo la hipótesis nula (las dos variantes convierten igual) se calcula la tasa agrupada, de ahí el error estándar agrupado, y el estadístico z es la diferencia de tasas dividida entre ese error. El valor p sale de la distribución normal estándar: bilateral usa las dos colas, unilateral solo una. El intervalo de confianza, en cambio, usa el error estándar SIN agrupar, porque un intervalo estima una diferencia real en lugar de suponer que las dos tasas son iguales. Usar el mismo error para las dos cosas es un atajo común y está mal en los dos sentidos.

06

Qué significa realmente el valor p

Es la probabilidad de observar una diferencia al menos tan grande como la tuya SI las dos variantes convirtieran exactamente igual. No es la probabilidad de que B sea mejor, y no es la probabilidad de que te equivoques. Un valor p de 0,03 con un nivel de confianza del 95 % significa que el resultado es más extremo de lo que el azar produce el 95 % de las veces, nada más.

07

No significativo no quiere decir iguales

Es la confusión más cara de esta disciplina. Que la prueba no distinga las dos variantes casi siempre significa que todavía no hay datos suficientes, no que la diferencia sea cero. Por eso el resultado va acompañado del intervalo de confianza: si el intervalo va de -1 a +3 puntos porcentuales, sabes que una mejora de 3 puntos sigue siendo compatible con lo que has medido.

08

Significancia estadística no es importancia para el negocio

Con tráfico suficiente, una mejora del 0,1 % sale significativa y no compensa el coste de implementarla. Con poco tráfico, una mejora del 30 % puede no alcanzar la significancia y aun así merecer la pena probarla más. Decide qué tamaño de cambio justifica actuar ANTES de lanzar la prueba, no después de ver el resultado.

09

Cuándo la prueba no es fiable

La aproximación normal en la que se apoya necesita un mínimo de datos. Con menos de 5 conversiones o no conversiones esperadas en alguna variante, o con menos de 100 visitas, la herramienta avisa: el valor p sigue apareciendo pero hay que tratarlo como orientativo. Lo mismo si una de las variantes no convirtió a nadie, porque el intervalo alrededor de una tasa cero es muy ancho.

10

Privacidad

Todo se calcula en tu navegador. Ninguna de las cifras que escribes se sube ni se guarda.

11

Preguntas frecuentes

¿Qué es el valor p?

La probabilidad de ver una diferencia al menos tan grande como la tuya si las dos variantes convirtieran igual. No es la probabilidad de que B sea mejor.

¿Bilateral o unilateral?

Bilateral salvo que tengas una razón concreta. La unilateral solo comprueba si B supera a A, y hay que elegirla antes de ver los datos: cambiar después infla los falsos positivos.

¿Qué nivel de confianza uso?

El 95 % es la convención. El 99 % exige más evidencia y el 90 % menos; lo importante es fijarlo antes de empezar.

¿Si no sale significativo, son iguales las variantes?

No. Casi siempre significa que aún no hay datos suficientes para distinguirlas. Mira el intervalo de confianza para ver qué diferencias siguen siendo compatibles con tus datos.

¿Cuántas visitas necesito?

Depende de la tasa base y del tamaño de mejora que quieras detectar. Como mínimo, la herramienta avisa por debajo de 100 visitas por variante o de 5 conversiones esperadas.

¿Puedo parar el test en cuanto salga significativo?

Es una mala idea. Mirar a diario y parar en el primer resultado bueno multiplica los falsos positivos. Fija el tamaño de muestra antes de empezar.

¿Falta una herramienta o encontraste un error?Construimos Tooleem según lo que necesitas. Cuéntanos qué agregar o corregir.
Cuéntanos