Calculadora de test A/B

Si la diferencia es real o casualidad — y cuántas visitas hacen falta.

3 % frente a 3,8 %: significativo al 95 % (p = 0,0273).

Resultado
significativo al 95 % — la diferencia ya no se explica bien por azar
Las dos tasas
A 3,00 %, B 3,80 %
Diferencia
0,8 puntos porcentuales, en relativo un 26,7 % — intervalo de confianza de 0,09 a 1,51 puntos
Valor z y valor p
z = 2,207, p = 0,0273
Tamaño de muestra necesario
harían falta 7140 visitas por variante para detectar una diferencia de este tamaño con un 80 % de probabilidad — hay 5000

Dos variantes casi siempre se diferencian en algo; la cuestión es si la diferencia es mayor de lo que explica el azar. Eso comprueba la prueba de significación: calcula qué probabilidad habría de ver esa diferencia si en realidad las dos fueran iguales.

Esa probabilidad es el valor p. Si queda por debajo del cinco por ciento, el resultado se considera significativo — no demostrado, sino lo bastante improbable como para dejar de atribuirlo a la casualidad.

El error más caro: mirar demasiado pronto

Quien comprueba a diario y para el test en cuanto aparece la significación encuentra casi siempre un resultado, incluso donde no lo hay. Al mirar una y otra vez, la probabilidad de un falso positivo sube muy por encima del cinco por ciento que uno cree estar aceptando.

Por eso el tamaño de muestra se fija antes y el test se lleva hasta el final. La calculadora indica cuántas visitas hacen falta por variante para poder planificarlo, en lugar de descubrirlo al terminar.

Significativo no es relevante

Con suficientes visitas, cualquier diferencia por pequeña que sea acaba siendo significativa. Pasar del 3,00 al 3,05 por ciento puede estar estadísticamente asegurado y ser completamente irrelevante, porque el trabajo del cambio nunca se recupera.

Al revés, un resultado no significativo no significa que las variantes sean iguales: significa que el test no ha podido decidirlo. El intervalo de confianza enseña qué diferencias siguen siendo posibles.

Preguntas frecuentes

¿Cuánto tiene que durar un test?
Una semana completa como mínimo, aunque el tamaño de muestra se alcance antes. El comportamiento cambia bastante entre los días laborables y el fin de semana, y un test de tres días entre semana mide el calendario, no al público.
¿Y si pruebo más de dos variantes?
Aumentan las comparaciones y con ellas la probabilidad de un falso positivo. Con tres variantes ya hay tres comparaciones por pares; conviene ajustar el nivel, por ejemplo dividiéndolo entre el número de comparaciones según Bonferroni.

Fuentes

Cifras vigentes en 2026. Los resultados son orientativos y no sustituyen a una asesoría laboral o fiscal.

También te puede servir