Clase 5: Regresión lineal y regularización
Eje II: Aprendizaje supervisado
Objetivo
Profundizar el uso de la regresión lineal con foco predictivo e introducir los métodos de regularización (Ridge y Lasso). La clase construye el método completo desde cero: qué recta buscamos, cómo se mide si una recta es buena, cómo se encuentra la mejor, y por qué la que mejor ajusta los datos que ya vimos no es la que mejor predice los que vienen.
Contenidos
- La recta y su notación:
y = mx + by el cambio a β₀ y β₁. - Mínimos cuadrados: residuos, RSS, la superficie de error sobre (β₀, β₁), y la fórmula analítica que da el mínimo exacto.
- Predecir o inferir: la misma cuenta contesta dos preguntas distintas, y lo que hay que mirar del modelo cambia según cuál sea.
- Evaluación: RSE, R² = 1 − RSS/TSS, y también MSE y RMSE. Siempre medidos fuera de muestra.
- Regresión múltiple: por qué los R² no se suman, el plano de ajuste, colinealidad e interacciones entre predictores.
- Regularización: penalizar los coeficientes, Ridge (ℓ₂), Lasso (ℓ₁) y su propiedad de selección de variables, y elastic net.
- Los seis problemas posibles de un ajuste lineal: no linealidad, errores correlacionados, varianza no constante, outliers, alto leverage y colinealidad.
- Comparación entre regresión lineal y KNN, y la maldición de la dimensionalidad.
La clase sigue con Nimbus, pero con una tabla nueva: la encuesta anual de clima 2026, que trae un índice de bienestar_laboral de 0 a 100 y diecinueve variables más. El salario no está en esa tabla, así que la clase arranca con un merge contra nimbus_salario.csv, que es exactamente lo que enseñó la Clase 2.
Ojo con los dos “bienestar”. El de esta clase es el índice anual de 0 a 100 de la encuesta de clima. No es el bienestar diario del piloto de la fruta (escala 1 a 7) que se usó en las clases 1, 2 y 3. Son dos variables distintas, con escalas distintas y años distintos.
Notebooks
La práctica guiada de la clase está en la notebook, y sigue el mismo orden que las diapositivas: primero se mueve una recta a mano y se miran los residuos, después se programa mínimos cuadrados sin librerías, se calculan RSE y R² a mano y se verifica que coincidan con los de la librería, se arma un modelo propio eligiendo variables de una lista, y se cierra partiendo en entrenamiento y testeo para ver cómo se separan los dos R² (y qué le hacen Ridge y Lasso a un modelo con pocos datos y muchas variables). Son ocho consignas, resueltas en clase.
| Lenguaje | Leer en el sitio | Ejecutar en Colab | Descargar |
|---|---|---|---|
| Python | Notebook renderizada | .ipynb |
|
| R | Notebook renderizada | .ipynb |
Las dos versiones cubren los mismos pasos y dan los mismos números. Dos diferencias propias de cada lenguaje, y las dos están anotadas en la notebook de R:
- El widget de sliders para mover β₀ y β₁ existe sólo en Python (
ipywidgets). La versión de R compara tres rectas fijas en su lugar. - Los valores de λ de Ridge y Lasso no son los mismos en los dos lenguajes:
glmnetparametriza la penalización de otra forma quescikit-learn. Lo que sí coincide es la conclusión.
Los datos
Los dos archivos se leen por URL desde la notebook, sin bajar nada.
| Archivo | Contenido | URL |
|---|---|---|
nimbus_clima.csv |
tabla nueva de esta clase: encuesta de clima 2026, con el índice bienestar_laboral (0-100) y 19 predictores |
/data/toy-nimbus/nimbus_clima.csv |
nimbus_salario.csv |
salario mensual y edad, 2023-2025 | /data/toy-nimbus/nimbus_salario.csv |
Slides
El trabajo integrador
Los últimos minutos de la clase son para el trabajo integrador. No es aplicar regresión al TP: es el paso que toca en el cronograma del trabajo, independientemente del método que se vio hoy. Tampoco se toca la notebook: es texto, en el Colab del trabajo integrador.
- Clase 3: el diagnóstico descriptivo de la base.
- Clase 4: una pregunta a nivel de proceso, con su foco definido: predecir o explicar.
Sobre la pregunta que quedó de la Clase 4, escriban un racional breve que responda:
1. ¿Por qué esta pregunta es relevante, para el campo de estudio o en términos prácticos? ¿A quién le importaría la respuesta?
2. ¿Qué se sabe, aunque sea de forma intuitiva, sobre este proceso?
3. ¿Qué esperan encontrar como respuesta, y por qué? Dejar la expectativa por escrito ahora es lo que después permite distinguir si el resultado sorprendió o no.
Alcanza con un racional que tenga sentido, en unas pocas líneas. Una fuente (un artículo, un capítulo, un informe) ayuda, pero no es requisito. El hito para la clase que viene es tener ese racional claro y la expectativa explícita escrita.
Lecturas
Obligatoria:
- James, G., Witten, D., Hastie, T., Tibshirani, R. & Taylor, J. (2023). An Introduction to Statistical Learning with Applications in Python (capítulos 3 y 6). Springer. Disponible completo en https://www.statlearning.com/. El capítulo 3 es la clase entera hasta regresión múltiple, incluidos los seis problemas posibles y la comparación con KNN. Del capítulo 6 se ve la sección de métodos de encogimiento (Ridge y Lasso).
Complementaria:
- Hastie, T., Tibshirani, R. & Friedman, J. (2009). The Elements of Statistical Learning (capítulo 6). Springer. El tratamiento formal de los métodos de regularización.
- James, G., Witten, D., Hastie, T. & Tibshirani, R. (2021). An Introduction to Statistical Learning with Applications in R (2.ª ed., capítulos 3 y 6). Springer. El mismo libro en R.
Recursos de consulta:
- Documentación de
LinearRegression,RidgeyLassoen scikit-learn. - Viñeta de
glmnet, que es el paquete de R para Ridge y Lasso, escrito por los autores del libro. - MLU-Explain: Linear Regression: una explicación visual e interactiva de mínimos cuadrados, los residuos y el R².