A/B testing en email — qué probar y cómo NO mentirse con los datos
"Hicimos A/B test y la versión B ganó por 3%". Si tu lista tenía 500 personas, ese 3% no es real — es ruido estadístico. La mayoría de PYMES toman decisiones basadas en datos que no significan nada.
Acá cómo hacerlo bien.
Las 3 reglas del A/B test válido
1. Una variable a la vez
Si cambiás subject + sender + CTA en la versión B y "B gana", no sabés cuál cambio funcionó.
Cambiá UNA cosa. Punto.
2. Muestra suficiente
Para detectar diferencia de 5% con 95% de confianza necesitás:
| Métrica base | Detect 5% lift | Detect 10% lift |
|---|---|---|
| 30% open rate | 5.000 emails | 1.500 emails |
| 5% click rate | 25.000 emails | 7.000 emails |
| 1% conversion | 100.000 emails | 30.000 emails |
Si tu lista es 500 personas y querés probar conversion: olvidalo, no hay manera de tener significancia.
3. Tiempo suficiente
Si parás el test a las 4 horas porque "ya se ve la diferencia", probablemente estés viendo ruido.
Mínimo 24 horas. Idealmente 48-72.
Los 8 elementos que más mueven CTR (en orden de impacto)
1. Subject line
El test #1 que todos hacen. Y el más impactante en open rate.
Variables a probar:
- Tipo (pregunta vs statement vs cifra)
- Longitud (corto vs medio)
- Tono (formal vs casual)
- Personalización (con merge tag vs sin)
2. Sender name
Quién envía:
- "Equipo de [marca]" vs "Enrique de [marca]"
- "[Marca]" vs "Enrique"
- "[Nombre real]" vs "[Nombre marketing]"
Personal > corporativo casi siempre.
3. Preview text
Lo que aparece después del subject en el inbox. Subestimado.
Test: subject genérico vs subject + preview que complementa.
4. CTA principal
- Texto: "Saber más" vs "Empezar gratis" vs "Ver planes"
- Color: depende de tu marca, pero alto contraste gana
- Posición: arriba vs abajo vs ambos
- Cantidad: 1 CTA vs 2-3 (1 casi siempre gana)
5. Longitud del email
Email corto (150-200 palabras) vs email largo (500-800 palabras).
Sin regla universal — depende del tipo de email. Pero testealo.
6. Imágenes vs plain text
Plain text suele tener mejor deliverability + mejor reply rate. Imágenes pueden disparar conversión visual en e-commerce.
Caso a caso.
7. Día y hora de envío
Más sutil de lo que parece. Mucho depende de timezone de tu lista.
Tests típicos:
- Martes vs jueves
- 9am vs 14hs vs 19hs (tu timezone)
8. Personalización
- Mismo email a toda la lista vs versión por segmento
- Con detalles del usuario vs genérico
Suele ganar la personalizada siempre que sea relevante.
Lo que NO vale la pena probar
- Color de un botón menor (3% lift no es real con tu sample).
- Tipografía diferente (impacto marginal).
- Saludo formal vs casual (a menos que tu marca sea muy formal).
- Hora de envío sin razón (esperá tener data baseline primero).
- Cualquier cosa con sample <1.000.
Calculadoras de significancia
Antes de declarar ganador, validá:
Pegale número de visitantes y conversiones de cada variante. Si no llega a 95% confianza → no es significativo.
Workflow de test bien hecho
1. Hipótesis clara
"Cambiar el sender de '[Marca]' a 'Enrique de [Marca]' va a subir el open rate ≥10%."
Hipótesis específica, con expectativa cuantificada.
2. Cálculo previo de muestra
Con calculadora de significancia: ¿cuántos emails necesito para confirmar/refutar la hipótesis con 95% confianza?
3. Setup limpio
- Solo cambia esa variable.
- Mismo segmento.
- Mismo momento.
- Random split 50/50.
4. Ejecución suficiente
Sample mínimo + tiempo mínimo (24-72h).
5. Análisis
- ¿La diferencia es estadísticamente significativa?
- ¿La diferencia es prácticamente significativa? (un 1% lift puede ser significativo estadísticamente pero irrelevante).
6. Documentación
Guarda en una hoja:
- Hipótesis
- Variantes
- Sample size
- Resultado
- Decisión tomada
3 meses después, revisá tus tests acumulados — patrones aparecen.
Tests que sí vale la pena hacer
Test #1 — Sender name
Genérico vs personal. Casi siempre ganador del personal.
Resultado típico: +5-15% open rate.
Test #2 — Subject style
Tu mejor variante de cada estilo (pregunta vs cifra vs controversial).
Resultado típico: el ganador depende del nicho — vale la pena testar todos.
Test #3 — CTA único vs múltiple
1 CTA vs 3 CTAs en el mismo email.
Resultado típico: 1 CTA gana 70% de las veces.
Test #4 — Tono
Formal corporativo vs casual humano.
Resultado típico: casual gana en B2C, mixto en B2B.
Test #5 — Hora de envío
Tu hora actual vs +3h vs -3h.
Resultado típico: pequeño lift (3-8%), pero compone con el tiempo.
Pruebas multivariadas
Probar 2 variables a la vez (multivariate):
Ejemplo: subject A vs B + sender C vs D = 4 versiones.
Para esto necesitás mucha más sample. Solo si tu lista es >50K activos.
PYMES típicas: quedate con A/B simple.
Errores frecuentes
- Parar el test antes de tiempo. "B ganó las primeras 2 horas → cancelar A". Premature stopping.
- Testear todo sin priorizar. Probá lo que más mueve la aguja primero.
- No documentar. 6 meses después olvidás qué probaste y por qué.
- Aplicar lifts marginales como ley. "+1.2% lift no significativo" no debería cambiar tu estrategia.
- No testear variables grandes. La gente prueba color de botón cuando debería estar probando estructura completa del email.
Stack recomendado
| ESP | A/B nativo | Multivariado |
|---|---|---|
| Klaviyo | Sí | Sí (premium) |
| Brevo | Sí | No |
| HubSpot | Sí | Sí (Pro) |
| ActiveCampaign | Sí | Sí |
| ConvertKit | Sí (Pro) | No |
Para volumen mayor, casi todos sirven. Para volumen <5K, ESP económico + análisis manual.
Conclusión
A/B testing en email mal hecho es peor que no testear — toma decisiones con datos que no significan nada. Bien hecho, es el camino más rápido para optimizar tu canal de email.
Empezá testando 1-2 cosas grandes (sender name + estilo de subject line). Aplicá los aprendizajes. Después escalás a tests más finos.
Y por favor: si tu sample es <1.000, no tomes decisiones permanentes basadas en ese test.
¿Listo para aplicar lo que acabas de leer?
Empieza gratis con 20 créditos para probar todas las herramientas.
Probar AI Marketing Pro


