TL;DR, Respuesta rápida
7 min de lecturaEl tamaño de muestra para pruebas A/B se fija antes de lanzar a partir de tres datos: la tasa de conversión base, el efecto mínimo detectable y la potencia estadística requerida, normalmente 80%, con un nivel de significación elegido, normalmente 95%. Un test que mueve una base del 5% con un efecto mínimo detectable de 1 punto porcentual necesita unos 8,146 visitantes por variante. Revisar los resultados antes de alcanzar esa cifra y detenerse ante un giro favorable infla la tasa de falsos positivos por encima del nivel de significación que el test debía mantener.
¿Cómo calcular el tamaño de muestra para pruebas A/B?
Tres datos deciden el tamaño de muestra para pruebas A/B antes de que un solo visitante vea el test: la tasa de conversión base, el efecto mínimo detectable y la potencia estadística requerida. Introduce esos tres valores en la fórmula del tamaño de muestra junto con un nivel de significación elegido, y la fórmula devuelve el número de visitantes que cada variante necesita antes de poder leer el test. Calcula ese número antes de lanzar, no después de que el test lleve una semana corriendo y alguien quiera una respuesta anticipada, y úsalo para decidir el objetivo de una buena tasa de conversión del test antes de comparar el resultado con cualquier referencia externa.
¿Qué es la tasa de conversión base?
La tasa de conversión base es la tasa actual de la métrica que se está probando, medida en la página antes de que se lance cualquier cambio, usando la misma fórmula de la tasa de conversión que la empresa ya usa. Una página de pago que hoy convierte al 5% es la base para un test en esa misma página, y la fórmula define cualquier otro dato en relación con ese número de partida. Toma la base de al menos dos a cuatro semanas de tráfico típico, no de un solo día atípico.

¿Qué es el efecto mínimo detectable?
El efecto mínimo detectable es el cambio más pequeño en la tasa de conversión que el test está diseñado para detectar, expresado como la diferencia entre la tasa base y la tasa objetivo. Elegir un efecto mínimo detectable de 1 punto porcentual sobre una base del 5% significa que el test está diseñado para detectar de forma fiable un salto al 6%, y no detectará de forma fiable un movimiento más pequeño como 5.3%. Un efecto mínimo detectable más pequeño necesita una muestra más grande, porque la fórmula tiene que separar una diferencia menor del ruido aleatorio.
¿Qué significa la potencia estadística en una prueba A/B?
La potencia estadística es la probabilidad de que el test detecte un efecto real del tamaño elegido, cuando ese efecto realmente existe. Una potencia del 80%, el valor predeterminado habitual, significa que el test pasa por alto un efecto real una de cada cinco veces, así que subir la potencia al 90% detecta más efectos reales, pero exige una muestra más grande para lograrlo.
¿Qué significa el nivel de significación en una prueba A/B?
El nivel de significación es la probabilidad de declarar un ganador cuando no hay una diferencia real entre las variantes, normalmente fijado en 5%, lo que corresponde a un nivel de significación del 95%. Bajar esa tasa de falsos positivos al 1% hace el test más conservador y, como subir la potencia, aumenta el tamaño de muestra necesario para llegar a un veredicto, el mismo compromiso que da forma en general a las pruebas A/B en tráfico real.
¿Cuál es la fórmula del tamaño de muestra?
La fórmula del tamaño de muestra combina la tasa base, la tasa objetivo y los valores Z de la potencia y el nivel de significación elegidos en un solo cálculo por variante.
n = (Z(1-alpha/2) + Z(1-beta))^2 x [p1(1-p1) + p2(1-p2)] / (p2 - p1)^2
Aplícalo a un test de pago. La tasa de conversión base p1 es 5% (0.05), la tasa objetivo p2 es 6% (0.06) tras un efecto mínimo detectable de 1 punto porcentual, la significación es del 95% (Z = 1.96) y la potencia es del 80% (Z = 0.84).
| Dato | Símbolo | Valor |
|---|---|---|
| Tasa de conversión base | p1 | 5% |
| Tasa de conversión objetivo | p2 | 6% |
| Efecto mínimo detectable | p2 menos p1 | 1 punto porcentual |
| Nivel de significación | alpha | 5% (Z = 1.96) |
| Potencia estadística | beta | 80% (Z = 0.84) |
| Tamaño de muestra por variante | n | 8,146 visitantes |
(1.96 + 0.84)^2 = 7.84, y [0.05 x 0.95 + 0.06 x 0.94] = 0.1039. Dividir 7.84 x 0.1039 entre (0.01)^2 da 8,145.76, redondeado a 8,146 visitantes por variante, o unos 16,292 en total entre las dos variantes. Reducir a la mitad el efecto mínimo detectable, a 0.5 puntos porcentuales, cuadruplica aproximadamente esa cifra, porque el denominador eleva al cuadrado el tamaño del efecto.

- Una sola lectura, en el número que fija la fórmula
- El nivel de significación del 95% se mantiene como se diseñó
- Un resultado cuenta como decisión
- Revisado a diario durante dos semanas: catorce oportunidades para que el ruido cruce el umbral
- La tasa real de falsos positivos termina muy por encima del 5%
- Un giro favorable es informal, no un veredicto
¿Por qué mirar los resultados antes de tiempo rompe el cálculo del tamaño de muestra?
Mirar los resultados antes de alcanzar el tamaño de muestra calculado rompe el test, porque cada vistazo anticipado es una nueva oportunidad para que el ruido aleatorio cruce el umbral de significación. Un test revisado a diario durante dos semanas le da a la variación aleatoria catorce oportunidades distintas de producir un falso positivo, así que la tasa real de falsos positivos termina muy por encima del 5% que el test debía mantener, aunque cada revisión individual haya usado un umbral válido del 95%. Fija el tamaño de muestra antes de lanzar, corre el test hasta esa cifra sin buscar un veredicto por el camino, y usa los datos de embudo y de metas para confirmar la tasa de tráfico diaria necesaria para llegar a tiempo.
Preguntas frecuentes
¿Qué tamaño de muestra necesito para una prueba A/B?
El tamaño de muestra depende de tu tasa de conversión base, el efecto mínimo detectable y la potencia y el nivel de significación elegidos, y no hay una cifra fija que aplique a todos los tests. Un test que mueve una base del 5% en 1 punto porcentual con 80% de potencia y 95% de significación necesita unos 8,146 visitantes por variante.
¿Cuál es un buen efecto mínimo detectable?
Un buen efecto mínimo detectable es el cambio más pequeño que aún valdría la pena lanzar, no el cambio más pequeño que es teóricamente posible medir. Fijarlo demasiado pequeño obliga a un tamaño de muestra excesivamente grande; fijarlo demasiado grande deja pasar mejoras reales, más pequeñas, sin que el test las detecte.
¿Por qué los efectos más pequeños necesitan muestras más grandes?
Los efectos más pequeños necesitan muestras más grandes porque la fórmula del tamaño de muestra eleva al cuadrado el efecto mínimo detectable en el denominador, así que reducirlo a la mitad cuadruplica aproximadamente la muestra requerida. Un test diseñado para detectar un movimiento de 0.5 puntos porcentuales necesita unas cuatro veces más visitantes que uno diseñado para detectar 1 punto porcentual.
¿Qué pasa si detengo una prueba A/B antes de tiempo?
Detener una prueba A/B antes de tiempo, por un resultado que se ve favorable antes de alcanzar el tamaño de muestra calculado, infla la tasa real de falsos positivos por encima del nivel de significación que el test debía mantener. La confianza del 95% reportada ya no refleja las probabilidades reales de un ganador falso una vez que el equipo revisa los resultados y actúa sobre ellos de forma repetida.
Flowsery
Prueba gratuita
Panel en tiempo real
Seguimiento de objetivos
Rastreo sin cookies
¿Es siempre correcto usar una potencia del 80%?
Una potencia del 80% es un valor predeterminado habitual, no un requisito, y significa que el test pasa por alto uno de cada cinco efectos reales del tamaño elegido. Subir la potencia al 90% detecta más efectos reales a costa de un tamaño de muestra requerido mayor.
¿Puedo usar una muestra más pequeña si solo quiero una señal direccional?
Es posible correr por debajo del tamaño de muestra calculado para obtener una lectura direccional, pero el resultado carga con una probabilidad bastante más alta de ser ruido, no con una versión más pequeña de la misma confianza. Trata cualquier lectura tomada antes de alcanzar el tamaño de muestra objetivo como informal, y no la uses para tomar una decisión permanente.
¿Cuánto tiempo tarda en alcanzarse el tamaño de muestra necesario?
La fórmula devuelve un número de visitantes, no un número de días, así que el plazo depende del tráfico que ya recibe la página probada. Una página de checkout que necesita 8.146 visitantes por variante llega a esa cifra más rápido en una página con mucho tráfico que en una con poco. Revisar los datos de embudo y objetivos antes de lanzar muestra si la tasa de tráfico diaria actual puede alcanzar la meta en un plazo razonable.
¿Por qué medir la línea base durante dos a cuatro semanas en vez de un solo día?
Un solo día puede resultar inusualmente alto o bajo por razones que no tienen nada que ver con la prueba, como un fin de semana flojo o una campaña de marketing. Dos a cuatro semanas de tráfico típico suavizan esas variaciones y le dan a la fórmula una tasa de conversión base que realmente representa la página. Cada otro valor de la fórmula, incluida la tasa objetivo y el efecto mínimo detectable, se define en relación con ese número de partida.
¿La fórmula del tamaño de muestra asume que cada variante recibe el mismo tráfico?
La fórmula calcula n como el número de visitantes necesarios por variante, y el ejemplo del checkout aplica esos mismos 8.146 tanto al control como a la variante, para un total de 16.292. Eso significa que el cálculo asume una división pareja del tráfico entre las dos versiones comparadas. Una prueba que envía tráfico desigual a cada variante no alcanzará ambos tamaños de muestra al mismo tiempo.
¿Puede la tasa de conversión base venir de una página distinta a la que se está probando?
No, la línea base tiene que venir exactamente de la página donde correrá la prueba, medida en la métrica para la que esa página se está probando. Una página de checkout que convierte al 5% es la línea base para una prueba en esa misma página de checkout, no una tasa tomada de otra página o de otra métrica. Usar una tasa de otro lado rompe la relación que la fórmula necesita entre la línea base y la tasa objetivo.
¿Te resultó útil este artículo?
¡Cuéntanos qué opinas!
Vernos más en Google
Un clic marca Flowsery como fuente preferida y nuestros artículos aparecen más arriba en tus Noticias destacadas, el modo IA y los resúmenes con IA.
Antes de irte...
Flowsery
Analítica orientada a ingresos para tu sitio web
Rastrea cada visitante, fuente y conversión en tiempo real. Simple, potente y sin cookies.
Panel en tiempo real
Seguimiento de objetivos
Rastreo sin cookies
Términos relacionados del glosario


Cómo aplicar la fórmula del valor promedio del pedido paso a paso
La fórmula del valor promedio del pedido divide los ingresos entre pedidos, y un código de descuento puede distorsionar en silencio cada cifra reportada.


Dónde ocurre realmente la caída en un embudo de conversión
La conversión por paso y la conversión total responden preguntas distintas sobre un embudo de conversión, y su diferencia muestra dónde ocurre la caída.


La fórmula de tasa de conversión aplicada a tráfico real
La fórmula de tasa de conversión: conversiones entre sesiones o visitantes únicos, por 100. Una semana de tráfico por ambos denominadores da dos respuestas.


Estas cifras muestran la tasa de rebote media por industria
Nueve industrias registradas muestran una tasa de rebote media por industria documentada, entre 35.76% y 48.38%, según datos de Databox de septiembre de 2024.


Leer bien una curva de retención empieza con el análisis de cohortes
Una curva de retención solo tiene sentido cuando el análisis de cohortes agrupa usuarios por una misma fecha de inicio, ya que un promedio oculta el patrón.


Dos números se esconden detrás de una sola tasa de drop-off
Todo embudo produce dos cifras de tasa de drop-off, una por paso y otra de extremo a extremo, y los equipos las citan indistintamente. Una tabla las separa.
Artículos relacionados


Las decisiones de configuración detrás de todo análisis de embudos
Tres ajustes deciden qué reporta el análisis de embudos: la secuencia de pasos, la ventana de conversión y si el embudo cuenta usuarios o sesiones.


Cinco formas de calcular net revenue retention con los mismos datos
Una fórmula de net revenue retention, cinco variantes defendibles: la misma cohorte da 84.0%, 104.5%, 108.3%, 109.5% o 110.3% según la ventana y la base.


Cómo una ventana de atribución decide qué puntos de contacto cobran
Mueve la ventana de atribución de 7 a 90 días y un pedido de $1,800 paga a tres conjuntos de canales distintos. Mira la aritmética y los valores por defecto.

