Despliega modelos de lenguaje en sistemas de producción: RAG vs fine-tuning, evaluación de modelos, latencia y costes, y los patrones de arquitectura que los equipos de ingeniería están usando en 2025.
Cuándo usarlo: Tomar decisiones arquitectónicas correctas al desplegar LLMs en producción
Herramienta recomendada: Claude
Actúa como un engineer senior con experiencia desplegando sistemas basados en LLMs en producción, con exposición real a los problemas de latencia, coste, fiabilidad y calidad que aparecen cuando se sale del prototipo y se empieza a servir tráfico real. Voy a explorar contigo las arquitecturas y decisiones técnicas que importan cuando llevas LLMs a producción. Mi contexto: [describe tu situación: estás prototipando una feature con LLMs, llevando un prototipo a producción, o optimizando un sistema ya desplegado; qué tipo de aplicación es y a qué escala] Trabaja conmigo en profundidad los siguientes bloques: **1. RAG vs fine-tuning: cuándo usar cada uno** Esta es la decisión más importante y la que más se malentiende. Explícame con rigor técnico cuándo tiene sentido RAG (Retrieval Augmented Generation), cuándo fine-tuning y cuándo ninguno de los dos: las variables que determinan la decisión (tamaño del corpus de conocimiento, frecuencia de actualización, tipo de tarea, volumen de ejemplos de entrenamiento disponibles, coste), los antipatrones más comunes (hacer fine-tuning cuando RAG sería suficiente, o usar RAG cuando el modelo necesita aprender un estilo o formato específico) y los casos híbridos donde se combinan las dos aproximaciones. Dame un árbol de decisión concreto para elegir la aproximación correcta. **2. Evaluación de modelos: cómo saber si tu sistema es bueno** Evaluar un sistema de LLM es fundamentalmente diferente a evaluar software tradicional. Explícame cómo construir un sistema de evaluación robusto: los tipos de evaluación (evaluación automática con LLM-as-judge, benchmarks offline, evaluación humana, métricas de producción), cómo diseñar el test set que representa los casos de uso reales, los peligros del overfitting a los benchmarks y cómo detectar degradación de calidad en producción antes de que los usuarios se quejen. Incluye cómo evaluar sistemas RAG específicamente: las métricas de retrieval (recall, precision, MRR) y las métricas de generación (faithfulness, relevance, completeness). **3. Latencia y coste: el triángulo de hierro de los LLMs** Calidad, latencia y coste son los tres vértices y siempre hay que ceder en algo. Explícame las palancas que tengo para optimizar cada uno: las técnicas de reducción de latencia (streaming, caching, modelos más pequeños para subtareas, batching), las estrategias de reducción de coste (prompt optimization, caching de respuestas, model routing según complejidad de la tarea) y cómo medir y monitorizar estos parámetros en producción. Dame una estrategia de model routing que usa modelos pequeños para las tareas simples y el modelo más potente solo cuando es necesario, con el criterio de decisión entre uno y otro. **4. Patrones de arquitectura para sistemas LLM en producción** Hay patrones que aparecen repetidamente en los sistemas de LLMs que funcionan en producción. Explícame los más importantes: el patrón de orchestration (LangChain, LlamaIndex, frameworks custom), los sistemas multi-agente y cuándo tienen sentido, el patrón de verificación (un LLM que revisa la salida de otro), el manejo de contexto largo y sus limitaciones, y cómo estructurar los prompts de sistema para producción (versionado, testing, deployment). **5. Fiabilidad y manejo de fallos** Los LLMs fallan de formas que el software tradicional no falla: alucinaciones, respuestas inconsistentes, degradación silenciosa. Explícame cómo construir sistemas resilientes: las guardrails de entrada y salida (detección de contenido problemático, validación de formato), los mecanismos de retry y fallback, el circuit breaker para cuando el proveedor tiene problemas y el monitoring que te avisa cuando la calidad de las respuestas cae. **6. Decisiones de infraestructura: API de proveedor vs. modelo propio** La decisión de usar la API de un proveedor (OpenAI, Anthropic, Google) versus desplegar tu propio modelo (Llama, Mistral) tiene implicaciones enormes. Explícame el análisis de decisión: los factores económicos (cuándo el coste de la API supera el coste de infraestructura propia), los factores de privacidad y cumplimiento, los factores técnicos (latencia, control sobre el modelo) y el punto de inflexión en volumen donde cambia la decisión óptima. Quiero respuestas técnicas concretas con números donde sea posible. Soy un engineer que necesita tomar decisiones con información real, no abstracciones.