Growth

Test A/B

By Jake Luo · Published 6 sept 2026

Un test A/B consiste en poner en marcha dos versiones de la misma página, correo o flujo al mismo tiempo, repartir a las visitas entre ellas al azar y quedarse con la que gane de forma medible. La aleatoriedad y la simultaneidad son el método: son lo que impide confundir una diferencia de público, de día o de temporada con una diferencia de diseño. Su requisito no declarado es el volumen — un test solo responde algo cuando ha convertido suficiente gente dentro de cada rama, y por eso la mayoría de proyectos en fase inicial no puede hacer uno con honestidad.

Qué está controlando el reparto en realidad

El instinto detrás de un test A/B es averiguar qué versión es mejor, pero eso no es exactamente lo que hace el reparto. Publicar una página nueva un martes y comparar la quincena siguiente con la anterior también es una comparación — solo que lleva dentro un lanzamiento, un boletín, un festivo, el anuncio de un competidor y un cambio de posiciones. El reparto aleatorio existe para quitar todo eso de en medio. Las dos versiones corren en la misma ventana, delante del mismo tipo de tráfico, y lo único que difiere entre los dos grupos es lo único que has cambiado tú.

Por eso mismo, nombrar una única métrica principal antes de empezar importa más que la herramienta. Si decides después qué número mirar, encontrarás una versión ganadora en casi cualquier conjunto de datos, porque con suficientes métricas sobre la mesa siempre hay una que sube. Elegir de antemano es lo que convierte el ejercicio en un test y no en una búsqueda de buenas noticias.

Las cuatro cosas que necesita un test para poder decirte algo

A un test al que le falte cualquiera de estas cosas no te da una respuesta más floja. Te da una respuesta segura de sí misma que resulta ser falsa, que es peor, porque vas a actuar en consecuencia.

  • Una métrica principal, elegida de antemano — los registros, pongamos, y no el que de entre registros, clics y tiempo en página haya acabado moviéndose.
  • Suficientes conversiones en cada rama — cientos, no docenas. La restricción no son las visitas, son las conversiones, así que una página con mucho tráfico y una tasa de conversión pobre sigue sin tener datos.
  • Una regla de parada escrita antes — una fecha o un número de conversiones. Mirar a diario y parar en cuanto pinta bien es la manera de ascender el ruido a hallazgo.
  • Un cambio lo bastante grande como para mover el número — cuanto menor sea el efecto que persigues, mayor será la muestra que necesitas, y cambiar el color de un botón en un sitio pequeño es pedir una resolución que el tráfico no puede dar.

La aritmética que hay detrás del segundo punto es la que acaba con la mayoría de los planes. Detectar una mejora de aproximadamente el tres por ciento a aproximadamente el cuatro — real y muy digna de tener — exige del orden de varios miles de visitas por rama antes de que el resultado deje de ser un cara o cruz. Reduce a la mitad el tamaño del efecto que buscas y la muestra que necesitas se multiplica más o menos por cuatro.

Lo que dice sobre esto nuestro propio embudo

Usaremos nuestros propios números, porque son el caso corriente y no la excepción. En una semana reciente, 251 personas llegaron al panel con la sesión iniciada, 39 de ellas abrieron la página de planes y un número de un solo dígito siguió hasta el pago. Esos son los volúmenes con los que trabaja un producto real en fase inicial, y no son especialmente malos.

Parte esa página de planes por la mitad y cada versión recibe a cuatro o cinco personas por semana. Cualquier diferencia que vieras sería una diferencia de una o dos decisiones individuales, indistinguible de quién pasó por allí esa semana. Esperar a que se resuelva significa esperar meses, y a lo largo de esos meses el producto, los precios y la mezcla de tráfico cambian por debajo del test — así que lo que acabas midiendo no es lo que te propusiste medir.

Así que esas decisiones las tomamos con criterio, y decimos que es lo que estamos haciendo. La insignia de "Recomendado para ti" de nuestro selector de registro fue una decisión deliberada de enseñar una sola opción a todo el mundo en lugar de un test dividido, precisamente porque con nuestro volumen un reparto habría producido un número del que no nos podríamos fiar. Decirlo es la versión honesta. Describir un cambio no probado como basado en datos es la deshonesta, y es lo bastante frecuente como para que convenga suponerlo de la mayoría de las afirmaciones que leas.

Qué usar mientras no llega el tráfico

Las alternativas son menos satisfactorias y muchísimo más útiles a este tamaño. Cambia una cosa cada vez y lleva un registro fechado de lo que cambiaste, para que un antes y un después tengan al menos un borde. Mira lo que hace la gente de verdad — las grabaciones de sesión y la analítica de producto te enseñarán un campo de formulario que se abandona o un botón al que nunca se llega, y ninguna de las dos cosas necesita potencia estadística para creérsela. Y habla con quienes se cayeron por el camino: cinco conversaciones rinden más que un test sin potencia sobre la misma página, y además te dicen por qué y no solo cuál.

Dedica también el esfuerzo a los defectos antes que a las preferencias. Un pago que nadie encuentra, una página que no muestra nada durante veinte segundos, un formulario que descarta en silencio lo que has escrito — eso no son preguntas sobre qué versión prefiere la gente, y testarlas es un error de categoría. Arréglalas y vuelve a los tests cuando el volumen los aguante. El bucle más amplio en el que todo esto encaja es la optimización de la tasa de conversión; cuando sí tengas el tráfico, la herramienta de código abierto se parece a GrowthBook.

FAQ

¿Qué es un test A/B?
Un test A/B consiste en mostrar dos versiones de la misma página, correo o flujo al mismo tiempo, asignar al azar cada visita a una de ellas y quedarse con la que rinda mejor de forma medible en una métrica que elegiste antes de empezar. Que corran a la vez y que la asignación sea aleatoria es lo esencial: elimina las diferencias de momento y de público que hacen poco fiable una simple comparación de antes y después.
¿Cuánto tráfico necesito para hacer un test A/B?
Piensa en conversiones por rama, no en visitas. Como regla práctica quieres cientos de conversiones en cada versión antes de que el resultado signifique gran cosa, lo que en una página de registro típica implica varios miles de visitas por rama para detectar una mejora de en torno a un punto porcentual. Los efectos menores exigen muchísimo más: reducir a la mitad la diferencia que persigues multiplica la muestra aproximadamente por cuatro.
¿Cuánto tiempo debe durar un test A/B?
Fija el punto de parada antes de empezar, como una fecha o un número de conversiones, y respétalo. Haz que corra semanas enteras y no fracciones de semana, porque el tráfico de diario y el de fin de semana se comportan distinto. El fallo que hay que evitar es mirar a diario y parar en cuanto una versión va por delante: las ventajas tempranas se dan la vuelta constantemente, y un test detenido en su momento más halagüeño informa con toda fiabilidad de un efecto que no existe.
¿Puedo testar una página con unos pocos cientos de visitas al mes?
No de forma útil. Unos pocos cientos de visitas producirán un puñado de conversiones, repartidas entre dos ramas, y cualquier distancia entre ellas cae de lleno dentro del azar corriente. Acabarías esperando muchos meses, a lo largo de los cuales el resto del negocio cambia e invalida la comparación, o parando pronto y actuando sobre el ruido. A ese tamaño, los cambios secuenciales con un registro fechado, las grabaciones de sesión y las conversaciones con quienes abandonaron son los instrumentos que sí funcionan.
¿Es lo mismo un test A/B que la optimización de la tasa de conversión?
No. La optimización de la tasa de conversión es el bucle entero: encontrar dónde se cae la gente, formular una hipótesis sobre por qué, cambiar algo y comprobar si ha ayudado. El test A/B es una forma de hacer ese último paso, y solo está a tu alcance cuando el volumen lo permite. Los sitios pequeños siguen recorriendo el bucle; simplemente validan con un antes y un después cuidadoso y con evidencia cualitativa en lugar de con un reparto.
Related terms
Optimización de la Tasa de Conversión (CRO)Tasa de ActivaciónAnálisis de cohortesMétrica North Star

An AI growth team that runs this for you

AgentCeres is a managed AI marketing team — you approve what ships. 14-day free trial, from $39/month.

Start free trialBrowse the glossary