Clase 10: Reducción de dimensionalidad
Eje III: Aprendizaje no supervisado
Objetivo
Introducir las técnicas de reducción de dimensionalidad, con foco en el análisis de componentes principales (PCA) y su utilidad en problemas de Ciencias del Comportamiento.
Contenidos
- Motivación: alta dimensionalidad, ruido, visualización.
- Análisis de componentes principales (PCA): intuición geométrica e interpretación.
- Decisiones prácticas: estandarización, cantidad de componentes a retener.
- Mención introductoria a otros métodos no lineales (t-SNE, UMAP).
- Combinación de reducción de dimensionalidad con clustering.
La clase está construida sobre las secciones 12.1 y 12.2 de ISLP, con la intuición inicial tomada de la sección 6.3.1. El recorrido va de la intuición en dos dimensiones (la recta de máxima varianza, que es también la recta más cercana a los puntos) al caso de muchas variables, e incluye la reconstrucción de un dato a partir de sus componentes, la lectura completa de un biplot y la conexión entre varianza explicada y \(R^2\).
Notebooks
La explicación se apoya de punta a punta en un dataset real de deserción y éxito académico (4424 estudiantes de educación superior). El resultado que ordena la clase: sin usar en ningún momento la etiqueta de deserción, la primera componente principal resulta ser un eje de riesgo académico que separa a quienes desertan de quienes se gradúan. El ejercicio de cierre aplica todo lo visto al dataset de rotación de personal (attrition) que se viene usando desde la Clase 2, combinando PCA con clustering para descubrir perfiles latentes de empleados.
| Dataset | Dónde se usa | Fuente |
|---|---|---|
| Deserción y éxito académico | Secciones 1 a 5 (toda la explicación) | UCI, dataset 697 (CC BY 4.0) |
| HR Employee Attrition | Ejercicio de cierre | IBM |
| Lenguaje | Leer en el sitio | Ejecutar en Colab |
|---|---|---|
| Python (principal) | Notebook renderizada | |
| R (par validado) | Notebook renderizada |
Las dos notebooks recorren el mismo análisis con las mismas conclusiones: elegí el lenguaje en el que quieras trabajar. La versión Python es la del dictado; la versión R es material de referencia equivalente.
Slides
Lecturas
Obligatoria:
- James, G., Witten, D., Hastie, T., Tibshirani, R. & Taylor, J. (2023). An Introduction to Statistical Learning with Applications in Python, capítulo 12. Springer. statlearning.com (gratuito, oficial).
Complementaria (referencia en R):
- James, G., Witten, D., Hastie, T. & Tibshirani, R. (2021). An Introduction to Statistical Learning with Applications in R (2ª ed.), capítulo 12. Springer. statlearning.com (gratuito, oficial).