Fija el umbral de calidad aceptable, qué tipos de error se toleran y cuáles no, cómo se despliega por fases y en qué condiciones se retira, para no lanzar por sensación ni bloquear por miedo.
Cuándo usarlo: Decidir cuándo una función con IA está lista para lanzarse, con clasificación de errores por consecuencia, umbral, despliegue por fases y protocolo de retirada
Herramienta recomendada: Claude
Actúa como product manager con experiencia lanzando funciones basadas en modelos de lenguaje. Vamos a lanzar una y necesito una decisión defendible sobre cuándo está lista. ## Contexto que necesito 1. Qué hace la función y qué entrega al usuario. 2. Qué hace el usuario con esa salida y qué pasa si es incorrecta. 3. Puede el usuario verificar el resultado por sí mismo, sí o no. 4. Alternativa actual: cómo lo resuelve hoy y con qué tasa de error humano. 5. Qué medimos ya (si tenemos evaluaciones) y qué resultados dan. ## Paso 1 — Clasificar los errores por consecuencia No todos los fallos son iguales, y este es el análisis que casi nunca se hace: | Tipo de error | Ejemplo en mi función | Detectable por el usuario | Coste | Tolerancia | |---|---|---|---|---| | Vacío o negativa | No responde | Sí | Bajo | Alta | | Incompleto | Se deja parte | A veces | Medio | Media | | Plausible pero falso | Inventa un dato creíble | No | Alto | Muy baja | | Fuera de tono o de marca | Suena a otra empresa | Sí | Medio | Baja | | Dañino | Consejo peligroso, filtra datos | No siempre | Muy alto | Cero | El error plausible pero falso es el que hunde la confianza, porque el usuario no puede detectarlo. Si tu función es propensa a ese error y el usuario no puede verificar, el umbral tiene que ser muy alto o hay que rediseñar la función para que muestre sus fuentes. ## Paso 2 — Umbral y comparación correcta Fija el umbral contra la alternativa real, no contra la perfección: si el proceso humano actual falla el 8% de las veces, exigir 0% a la función es una decisión política, no de calidad. Define: - Métrica principal y su umbral mínimo para lanzar. - Tolerancia cero para los errores de la última fila. - Muestra sobre la que se mide y quién la juzga. ## Paso 3 — Diseño del despliegue | Fase | Audiencia | Duración | Qué se vigila | Criterio para avanzar | |---|---|---|---|---| | Interna | Equipo | 1-2 semanas | Errores graves | Cero errores dañinos | | Beta | Usuarios que aceptan probar | 2-4 semanas | Umbral + satisfacción | Umbral sostenido | | Parcial | % del tráfico | 2-4 semanas | Métricas de negocio | Sin daño en las de control | | General | Todos | — | Vigilancia continua | — | ## Paso 4 — Retirada Define de antemano: qué señal obliga a desactivar, quién puede hacerlo sin pedir permiso, cómo se avisa a los usuarios y qué queda mientras tanto. Una función con IA sin interruptor es un riesgo operativo, no una función. ## Paso 5 — Qué se promete al usuario El copy y las expectativas: qué decimos que hace, qué decimos que no garantiza, dónde se le pide que revise. Prometer menos y cumplirlo funciona mejor que lo contrario, sobre todo la segunda semana. ## Entregables 1. Tabla de errores clasificados para mi función concreta. 2. Umbral de lanzamiento con la comparación contra la alternativa actual. 3. Plan de despliegue por fases con criterios de avance. 4. Protocolo de retirada con responsables. 5. Copy de expectativas y de revisión.