Los conceptos de álgebra lineal, cálculo y probabilidad que necesitas para entender (y no solo usar) los algoritmos de ML: lo esencial explicado con intuición visual y código, sin perder rigor.
Cuándo usarlo: Entender la base matemática del machine learning para aplicar los algoritmos con mayor criterio
Herramienta recomendada: Claude
Actúa como un investigador de machine learning con habilidad para explicar conceptos matemáticos complejos con intuición geométrica y código, haciendo accesible la base matemática del ML a programadores que tienen experiencia práctica con las herramientas pero sienten que les falta el fundamento teórico. Voy a explorar contigo las matemáticas que necesito para entender el machine learning en profundidad. Mi contexto: [describe tu situación: si ya usas scikit-learn, TensorFlow o PyTorch, los algoritmos que usas habitualmente, y los conceptos matemáticos específicos que sabes que no entiendes bien (matrices, derivadas, probabilidades, etc.)] Trabaja conmigo en profundidad los siguientes bloques: **1. Álgebra lineal: la geometría detrás del ML** El álgebra lineal es el lenguaje matemático del machine learning. Explícame los conceptos esenciales con intuición geométrica antes que con fórmulas: los vectores como puntos o direcciones en el espacio (y por qué un datapoint con 100 features es un punto en un espacio de 100 dimensiones), las matrices como transformaciones que rotan, escalan o proyectan vectores, la multiplicación de matrices como composición de transformaciones, los conceptos de rango, dependencia lineal y espacio nulo (con la intuición de qué información contiene una matriz) y la descomposición en valores singulares (SVD) como la operación que está detrás de la reducción de dimensionalidad y las recomendaciones. Para cada concepto, dame el código Python que lo ilustra. **2. Cálculo: cómo aprenden los modelos** El descenso por gradiente es el motor de aprendizaje de casi todos los modelos modernos de ML, y para entenderlo necesitas entender las derivadas. Explícame el cálculo necesario para el ML desde la intuición: las derivadas como la tasa de cambio local de una función (la pendiente de la función en un punto), el gradiente como la generalización de la derivada a múltiples dimensiones (el vector que apunta en la dirección de máximo aumento de la función), el descenso por gradiente como el algoritmo que camina cuesta abajo en el paisaje de la función de pérdida, la regla de la cadena como el mecanismo del backpropagation y por qué la diferenciación automática (autograd) es uno de los inventos más importantes del ML moderno. **3. Probabilidad y estadística: la incertidumbre en el ML** El machine learning es fundamentalmente un problema de inferencia estadística. Explícame los conceptos de probabilidad que necesitas para entender los modelos de ML: la diferencia entre probabilidad frecuentista y bayesiana (y por qué importa para el ML), las distribuciones de probabilidad más importantes en ML (gaussiana, Bernoulli, categórica, Poisson) y su aplicación en los modelos, el concepto de verosimilitud (likelihood) y cómo los modelos se entrenan maximizando la verosimilitud de los datos, el teorema de Bayes y su rol en la clasificación bayesiana y en la inferencia variacional y la entropía como medida de incertidumbre que está detrás del árbol de decisión y la información mutua. **4. La función de pérdida: qué aprende realmente el modelo** La función de pérdida es el objetivo que el modelo minimiza durante el entrenamiento. Explícame las funciones de pérdida más importantes y su derivación matemática: el error cuadrático medio (MSE) para regresión y su relación con la distribución gaussiana del error, la entropía cruzada (cross-entropy) para clasificación y su derivación desde la verosimilitud, la pérdida de bisagra (hinge loss) de las SVM, la pérdida focal para problemas con clases desbalanceadas y por qué elegir la función de pérdida correcta es una decisión matemáticamente fundamentada, no arbitraria. **5. La regularización: el balance entre ajuste y generalización** La regularización es la técnica matemática que previene el sobreajuste. Explícame las formas de regularización más comunes y su fundamento matemático: la regularización L1 (Lasso) y L2 (Ridge) como penalizaciones a la magnitud de los pesos del modelo, la interpretación bayesiana de la regularización (como la imposición de un prior sobre los pesos), el dropout como forma de regularización en redes neuronales (con la interpretación de conjunto de modelos), el early stopping como forma implícita de regularización y los métodos de selección de hiperparámetros (validación cruzada) como la forma correcta de elegir el nivel de regularización. **6. La geometría de los modelos de ML** La intuición geométrica ayuda a entender por qué los modelos de ML funcionan o fallan. Explícame la geometría de los modelos más importantes: la regresión lineal como proyección de los datos sobre el subespacio de las features, la regresión logística como un hiperplano de decisión en el espacio de features, las redes neuronales como transformaciones sucesivas del espacio de entrada que hacen que los datos sean linealmente separables, los kernels de las SVM como transformaciones implícitas a espacios de alta dimensión y el t-SNE y UMAP como proyecciones no lineales que preservan la estructura local de los datos. Quiero visualizaciones conceptuales y código Python que ilustre cada concepto, para que la matemática sea concreta y aplicable.