El framework estadístico correcto para los experimentos de producto: el diseño del experimento, el cálculo del power estadístico, la detección de efectos de network y los errores estadísticos que hacen que muchos equipos de producto tomen decisiones equivocadas basándose en datos incorrectamente interpretados.
Cuándo usarlo: Construir el framework de experimentación estadísticamente riguroso que permite tomar mejores decisiones de producto basadas en evidencia.
Herramienta recomendada: Claude
Eres un experto en experimentación en producto y estadística aplicada al desarrollo de productos digitales. Necesito que me ayudes a construir el framework de experimentación estadísticamente riguroso que permita a mi equipo tomar mejores decisiones de producto basadas en evidencia real. Mi contexto: - Tipo de producto: [app móvil / web app / marketplace / SaaS / plataforma] - Volumen de usuarios mensuales activos: [necesario para evaluar la viabilidad de los tests A/B] - Estado actual de la experimentación: [sin tests A/B / tests A/B básicos sin rigor estadístico / plataforma de experimentación establecida pero con problemas de interpretación] - Herramientas de experimentación: [Optimizely / LaunchDarkly / Firebase A/B Testing / Growthbook / herramienta propia / ninguna] - Principal problema con los experimentos: [no sabemos cuántos usuarios necesitamos / paramos los tests cuando vemos resultados positivos / tenemos muchos tests pero las decisiones siguen siendo por intuición / no sabemos qué hacer con los tests nulos] Con ese contexto, dame: 1. LOS FUNDAMENTOS ESTADÍSTICOS DE LA EXPERIMENTACIÓN Explícame los conceptos estadísticos que todo product manager que diseña experimentos debe dominar: - La hipótesis nula y la hipótesis alternativa: qué son y cómo formularlas correctamente para un experimento de producto - Los errores tipo I y tipo II: la diferencia entre un falso positivo (detectar un efecto que no existe) y un falso negativo (no detectar un efecto que sí existe), y cómo el nivel de significación (alpha) y el power (1-beta) controlan cada uno - El p-value: qué significa exactamente p < 0.05, qué no significa y por qué el p-value solo es interpretable junto al tamaño del efecto y el intervalo de confianza - El efecto mínimo detectable (MDE): qué es, por qué es el parámetro más importante del diseño del experimento y cómo elegirlo en base a lo que es relevante para el negocio (no en base a lo que el experimento puede detectar) 2. EL CÁLCULO DEL TAMAÑO DE MUESTRA ¿Cuántos usuarios necesito en cada variante para que el resultado del test sea fiable? Dame el framework completo: - La fórmula del tamaño de muestra y sus inputs: el MDE, el alpha (nivel de significación), el power (1-beta), el valor de la métrica en el control y la varianza de la métrica - Cómo calcular el tamaño de muestra para diferentes tipos de métrica: métricas binarias (tasa de conversión), métricas continuas (ingresos por usuario, tiempo en sesión) y métricas de ratio (ratio de likes/sesión) - Las herramientas para calcular el tamaño de muestra sin hacer los cálculos a mano: las calculadoras online, las bibliotecas de Python y los recursos internos que debo construir - Cuánto tiempo debo dejar correr el test: la conversión del tamaño de muestra en tiempo dado el volumen diario de usuarios expuestos 3. LOS ERRORES ESTADÍSTICOS MÁS FRECUENTES Dame el catálogo de los errores estadísticos que hacen que los equipos de producto tomen decisiones equivocadas: - Peeking: por qué parar el test cuando el resultado parece positivo o negativo infla el error tipo I dramáticamente y qué hacer en su lugar (sequential testing, métodos bayesianos, CUPED) - Multiple comparisons: por qué testear múltiples métricas o múltiples variantes sin corrección estadística aumenta la tasa de falsos positivos y cómo hacer la corrección (Bonferroni, Benjamini-Hochberg) - El Novelty Effect: por qué los usuarios reaccionan de forma diferente a lo nuevo y cómo distinguir el efecto de novedad del efecto real del cambio - SRM (Sample Ratio Mismatch): qué es, cómo detectarlo y por qué invalida cualquier conclusión del experimento si no se corrige - La confusión de correlación y causalidad en los experimentos: por qué incluso un experimento mal diseñado puede producir correlaciones espurias 4. EFECTOS DE NETWORK Y SPILLOVER Los tests A/B asumen que los usuarios del control y la variante son independientes. En muchos productos esto no es verdad. Dame el framework: - El problema del spillover: qué ocurre cuando los usuarios del control y de la variante interactúan entre sí (productos sociales, marketplaces, colaboración) y por qué el test A/B clásico no funciona en estos casos - Las técnicas de experimentación que manejan el spillover: el clustering geográfico, el holdout temporal, el switchback experiment, los graph cluster experiments - El network effect en los experimentos de features: cómo diseñar experimentos en productos con efectos de red sin contaminar el grupo de control - El SUTVA (Stable Unit Treatment Value Assumption): qué es, cuándo se viola y qué hacer cuando se viola 5. MÉTRICAS DE EXPERIMENTACIÓN: CUÁLES USAR Y CUÁLES IGNORAR ¿Cómo elegir la métrica correcta para cada experimento? Dame el framework de selección de métricas: - La métrica primaria vs métricas de guardrail: por qué cada experimento debe tener una sola métrica primaria de decisión y un conjunto de métricas de guardrail que no deben deteriorarse - Las métricas que son malas para los tests A/B: las métricas con alta varianza (ingresos por usuario con outliers extremos) y cómo transformarlas para aumentar el power del test - El método CUPED (Controlled-experiment Using Pre-Experiment Data): cómo usar los datos pre-experimento para reducir la varianza de la métrica y detectar efectos más pequeños con menos usuarios - Las métricas de largo plazo y el problema de los experimentos cortos: cómo los experimentos de corto plazo pueden subestimar el impacto en métricas de largo plazo como la retención 6. LA PLATAFORMA DE EXPERIMENTACIÓN ¿Qué infraestructura técnica necesita un equipo de producto para experimentar de forma eficiente y rigurosa? Dame el diseño: - Los componentes de una plataforma de experimentación: el sistema de asignación aleatoria, el tracking de la exposición al experimento, el cálculo de métricas, el análisis estadístico y el sistema de decisión - Los requisitos de la asignación aleatoria: por qué la aleatorización a nivel de usuario, sesión o dispositivo produce resultados diferentes y cómo elegir la unidad correcta - La integración con el data warehouse: cómo conectar los datos de exposición al experimento con los datos de comportamiento del usuario para calcular las métricas de impacto - El build vs buy: cuándo tiene sentido construir la plataforma propia vs usar herramientas comerciales 7. LA CULTURA DE EXPERIMENTACIÓN EN EL EQUIPO DE PRODUCTO ¿Cómo crear una cultura de equipo de producto que tome decisiones basadas en evidencia? Dame el plan: - El proceso de revisión de experimentos: cómo hacer la review estadística de los resultados antes de tomar la decisión de lanzar o descartar - El registro de experimentos: por qué documentar las hipótesis, el diseño y los resultados de cada experimento es imprescindible para aprender y no repetir errores - Cómo comunicar los resultados de los experimentos: qué incluir en el reporte de resultados, cómo presentar la incertidumbre y cómo comunicar los resultados nulos sin que el equipo los perciba como fracasos - La velocidad de experimentación: cómo aumentar el número de experimentos por semana sin comprometer el rigor estadístico