Clase 5: Regresión lineal y regularización

Eje II: Aprendizaje supervisado

Objetivo

Profundizar el uso de la regresión lineal con foco predictivo e introducir los métodos de regularización (Ridge y Lasso). La clase construye el método completo desde cero: qué recta buscamos, cómo se mide si una recta es buena, cómo se encuentra la mejor, y por qué la que mejor ajusta los datos que ya vimos no es la que mejor predice los que vienen.

Contenidos

  • La recta y su notación: y = mx + b y el cambio a β₀ y β₁.
  • Mínimos cuadrados: residuos, RSS, la superficie de error sobre (β₀, β₁), y la fórmula analítica que da el mínimo exacto.
  • Predecir o inferir: la misma cuenta contesta dos preguntas distintas, y lo que hay que mirar del modelo cambia según cuál sea.
  • Evaluación: RSE, = 1 − RSS/TSS, y también MSE y RMSE. Siempre medidos fuera de muestra.
  • Regresión múltiple: por qué los R² no se suman, el plano de ajuste, colinealidad e interacciones entre predictores.
  • Regularización: penalizar los coeficientes, Ridge (ℓ₂), Lasso (ℓ₁) y su propiedad de selección de variables, y elastic net.
  • Los seis problemas posibles de un ajuste lineal: no linealidad, errores correlacionados, varianza no constante, outliers, alto leverage y colinealidad.
  • Comparación entre regresión lineal y KNN, y la maldición de la dimensionalidad.
NotaNimbus, la encuesta de clima

La clase sigue con Nimbus, pero con una tabla nueva: la encuesta anual de clima 2026, que trae un índice de bienestar_laboral de 0 a 100 y diecinueve variables más. El salario no está en esa tabla, así que la clase arranca con un merge contra nimbus_salario.csv, que es exactamente lo que enseñó la Clase 2.

Ojo con los dos “bienestar”. El de esta clase es el índice anual de 0 a 100 de la encuesta de clima. No es el bienestar diario del piloto de la fruta (escala 1 a 7) que se usó en las clases 1, 2 y 3. Son dos variables distintas, con escalas distintas y años distintos.

Notebooks

La práctica guiada de la clase está en la notebook, y sigue el mismo orden que las diapositivas: primero se mueve una recta a mano y se miran los residuos, después se programa mínimos cuadrados sin librerías, se calculan RSE y R² a mano y se verifica que coincidan con los de la librería, se arma un modelo propio eligiendo variables de una lista, y se cierra partiendo en entrenamiento y testeo para ver cómo se separan los dos R² (y qué le hacen Ridge y Lasso a un modelo con pocos datos y muchas variables). Son ocho consignas, resueltas en clase.

Lenguaje Leer en el sitio Ejecutar en Colab Descargar
Python Notebook renderizada Open in Colab .ipynb
R Notebook renderizada Open in Colab .ipynb

Las dos versiones cubren los mismos pasos y dan los mismos números. Dos diferencias propias de cada lenguaje, y las dos están anotadas en la notebook de R:

  • El widget de sliders para mover β₀ y β₁ existe sólo en Python (ipywidgets). La versión de R compara tres rectas fijas en su lugar.
  • Los valores de λ de Ridge y Lasso no son los mismos en los dos lenguajes: glmnet parametriza la penalización de otra forma que scikit-learn. Lo que sí coincide es la conclusión.

Los datos

Los dos archivos se leen por URL desde la notebook, sin bajar nada.

Archivo Contenido URL
nimbus_clima.csv tabla nueva de esta clase: encuesta de clima 2026, con el índice bienestar_laboral (0-100) y 19 predictores /data/toy-nimbus/nimbus_clima.csv
nimbus_salario.csv salario mensual y edad, 2023-2025 /data/toy-nimbus/nimbus_salario.csv

Slides

Diapositivas de la clase

El trabajo integrador

Los últimos minutos de la clase son para el trabajo integrador. No es aplicar regresión al TP: es el paso que toca en el cronograma del trabajo, independientemente del método que se vio hoy. Tampoco se toca la notebook: es texto, en el Colab del trabajo integrador.

NotaLo que ya tienen (o, mejor dicho, lo que ya deberían tener 🙂)
  • Clase 3: el diagnóstico descriptivo de la base.
  • Clase 4: una pregunta a nivel de proceso, con su foco definido: predecir o explicar.
ImportanteLo de hoy: justificar la pregunta

Sobre la pregunta que quedó de la Clase 4, escriban un racional breve que responda:

1. ¿Por qué esta pregunta es relevante, para el campo de estudio o en términos prácticos? ¿A quién le importaría la respuesta?

2. ¿Qué se sabe, aunque sea de forma intuitiva, sobre este proceso?

3. ¿Qué esperan encontrar como respuesta, y por qué? Dejar la expectativa por escrito ahora es lo que después permite distinguir si el resultado sorprendió o no.

NotaNo hace falta bibliografía

Alcanza con un racional que tenga sentido, en unas pocas líneas. Una fuente (un artículo, un capítulo, un informe) ayuda, pero no es requisito. El hito para la clase que viene es tener ese racional claro y la expectativa explícita escrita.

Lecturas

Obligatoria:

  • James, G., Witten, D., Hastie, T., Tibshirani, R. & Taylor, J. (2023). An Introduction to Statistical Learning with Applications in Python (capítulos 3 y 6). Springer. Disponible completo en https://www.statlearning.com/. El capítulo 3 es la clase entera hasta regresión múltiple, incluidos los seis problemas posibles y la comparación con KNN. Del capítulo 6 se ve la sección de métodos de encogimiento (Ridge y Lasso).

Complementaria:

  • Hastie, T., Tibshirani, R. & Friedman, J. (2009). The Elements of Statistical Learning (capítulo 6). Springer. El tratamiento formal de los métodos de regularización.
  • James, G., Witten, D., Hastie, T. & Tibshirani, R. (2021). An Introduction to Statistical Learning with Applications in R (2.ª ed., capítulos 3 y 6). Springer. El mismo libro en R.

Recursos de consulta: