Construye el modelo de machine learning que predice cuándo va a cancelar un cliente: las features, los algoritmos (logistic regression, random forest, gradient boosting) y el proceso de deploy e integración con la plataforma de CS que hace que el modelo sea útil.
Cuándo usarlo: Construir el modelo predictivo de churn con machine learning e integrarlo en los procesos del equipo de Customer Success.
Herramienta recomendada: Claude
Eres un experto en machine learning aplicado al Customer Success y en la construcción de modelos predictivos de churn. Necesito que me ayudes a construir el modelo que predice cuándo un cliente va a cancelar, integrarlo en los procesos del equipo de CS y hacerlo realmente útil para tomar decisiones de retención. Mi contexto: - Tipo de producto o servicio: [SaaS B2B / plataforma / servicio recurrente B2C / otro] - Tamaño de la cartera de clientes: [número de clientes activos — necesario para evaluar la viabilidad del modelo] - Datos disponibles: [datos de uso del producto, datos de CRM, datos de soporte, datos de encuestas, histórico de contratos] - Tasa de churn actual: [mensual o anual — necesario para entender la proporción de clase positiva] - Stack tecnológico de datos: [data warehouse en BigQuery/Snowflake/Redshift, CRM en Salesforce/HubSpot, plataforma de CS en Gainsight/ChurnZero/otra] - Nivel del equipo: [tenemos data scientists / tenemos ingenieros con conocimiento de ML / necesitamos una guía que cualquier analista pueda seguir] Con ese contexto, dame: 1. LOS DATOS: LA FUNDACIÓN DEL MODELO ¿Qué datos necesito para construir un modelo de churn de alta calidad? Dame el inventario de features por categoría: Features de uso del producto: frecuencia de login, número de features activas, volumen de uso de las features clave, tendencia del uso en los últimos 30 y 90 días, tiempo desde el último uso, ratio de usuarios activos sobre usuarios licenciados. Features de relación: NPS, CSAT, número de tickets de soporte abiertos y sin resolver, tiempo medio de resolución, número de escalaciones, última fecha de contacto con el CSM. Features de contrato: tiempo restante hasta la renovación, tamaño del contrato, tipo de plan, histórico de cambios de plan (upgrades o downgrades), histórico de pagos (retrasos, disputas). Features del cliente: tamaño de la empresa, sector, ubicación geográfica, fuente de adquisición, tiempo como cliente, número de expansiones previas. Dame además las señales de que los datos no están listos para el modelo y cómo prepararlos. 2. PREPARACIÓN DE LOS DATOS Y FEATURE ENGINEERING El modelo es tan bueno como los datos que lo alimentan. Dame el proceso de preparación: - La definición del label: cómo definir el churn como variable objetivo — la ventana de observación (qué período de datos uso para predecir) y la ventana de etiqueta (cuánto tiempo en el futuro quiero predecir) - El manejo de datos faltantes: las estrategias de imputación para cada tipo de feature y cuándo un dato faltante es en sí mismo una señal (el cliente que no hace login nunca tiene datos de uso faltantes, pero eso es la señal) - El feature engineering de tendencias: cómo construir las features de tendencia (caída del uso en los últimos 30 días respecto a los 30 anteriores) que suelen ser más predictivas que los valores absolutos - El problema del desbalanceo de clases: por qué en un modelo de churn la clase positiva (los que churnan) es minoritaria y cómo manejarlo — oversampling (SMOTE), undersampling, class weights, o cambiar la función de evaluación 3. LOS ALGORITMOS: CUÁL USAR Y CUÁNDO ¿Qué modelos de machine learning funcionan mejor para predecir el churn? Dame el análisis comparativo: - Regresión logística: las ventajas (interpretabilidad, rapidez, funciona bien con pocos datos) y las limitaciones (no captura relaciones no lineales). Cuándo elegirla como punto de partida - Random Forest: cómo combina múltiples árboles de decisión, por qué maneja bien las interacciones entre features y los valores atípicos, y cuándo supera a la regresión logística - Gradient Boosting (XGBoost, LightGBM, CatBoost): por qué suele dar el mejor rendimiento en tabular data de CS, las diferencias entre las implementaciones y los hiperparámetros más importantes que ajustar - El modelo de supervivencia (Kaplan-Meier, Cox Proportional Hazards): cuándo tiene sentido modelar el tiempo hasta el churn en lugar de predecir si el churn ocurrirá en una ventana temporal fija 4. ENTRENAMIENTO, VALIDACIÓN Y EVALUACIÓN ¿Cómo construir el modelo correctamente para que el rendimiento que reportamos sea el rendimiento real? Dame el framework: - El split de datos: la separación temporal — por qué no debo hacer un split aleatorio en datos de series temporales (el data leakage que produce modelos artificialmente buenos) - Las métricas de evaluación para churn: por qué el accuracy es la métrica incorrecta para un modelo con clases desbalanceadas y qué usar en su lugar — AUC-ROC, AUC-PR, F1-score, el análisis del coste de los falsos positivos (alertas innecesarias que queman el tiempo del CSM) vs los falsos negativos (churns que no detectamos) - La curva de lift y la curva de ganancias: cómo evaluar si el modelo es útil para priorizar la intervención del equipo de CS con recursos limitados - La validación cruzada temporal: cómo hacer cross-validation respetando el orden temporal de los datos 5. INTERPRETABILIDAD: POR QUÉ EL CLIENTE X ESTÁ EN RIESGO Un modelo que produce un score sin explicación es difícil de usar en la práctica. Dame el framework de interpretabilidad: - Los SHAP values: qué son, cómo calcularlos para cualquier modelo y cómo usarlos para explicar por qué un cliente específico tiene un riesgo alto de churn - La importancia de las features: cómo identificar las features más predictivas del modelo y qué nos dicen sobre los drivers del churn en nuestra base de clientes - La visualización para el equipo de CS: cómo mostrar en la interfaz del CSM las tres o cuatro razones principales del riesgo de churn de un cliente específico de forma que el CSM pueda actuar - Los límites de la explicabilidad: qué no podemos explicar y cómo comunicarlo honestamente 6. DEPLOY E INTEGRACIÓN EN EL WORKFLOW DE CS El mejor modelo es inútil si no está integrado en el proceso del equipo de CS. Dame el framework de implementación: - La arquitectura de deployment: cómo construir el pipeline de datos que alimenta el modelo de forma periódica (diaria o semanal), calcula los scores y los envía al CRM o a la plataforma de CS - La integración con el CRM y la plataforma de CS: cómo mostrar el score de riesgo en la vista del cliente en Gainsight, ChurnZero o HubSpot para que el CSM lo vea en su workflow natural - La automatización de alertas: cómo disparar automáticamente un task o un playbook cuando un cliente cruza el umbral de riesgo - El ciclo de feedback: cómo capturar el resultado de la intervención del CSM para usarlo en el reentrenamiento del modelo 7. MONITOREO Y MANTENIMIENTO DEL MODELO Un modelo en producción se degrada con el tiempo. Dame el framework de mantenimiento: - El concept drift: por qué el comportamiento de los clientes cambia (un competidor nuevo, una crisis económica, un cambio de producto) y cómo detectar cuándo el modelo ha dejado de ser preciso - Las métricas de monitoreo en producción: las alertas que deben dispararse cuando el rendimiento del modelo cae por debajo del umbral - El proceso de reentrenamiento: con qué frecuencia reentrenar el modelo y cuándo vale la pena hacer un rebuild completo vs simplemente actualizar los datos de entrenamiento - La documentación del modelo: el model card que documenta el propósito, el rendimiento, las limitaciones y el uso esperado del modelo — imprescindible para que el equipo pueda mantenerlo en el tiempo