Clase 10:
Reducción de dimensionalidad (PCA)
Analítica de Datos
Maestría en Ciencias del Comportamiento
Primavera 2026
Clase 10:
Reducción de dimensionalidad (PCA)
Analítica de Datos
Maestría en Ciencias del Comportamiento
Primavera 2026
Medimos ocho cosas de cada estudiante.
¿Se pueden resumir en una sola?
Datos reales de 4.424 estudiantes de educación superior: notas, materias inscriptas y aprobadas en dos semestres, nota de admisión y edad de ingreso.
Vamos a ver que la respuesta es sí, y que ese único número termina diciendo quién abandona.
Para la práctica vamos aColab.
BLOQUE 1 DE 6
Por qué reducir
Cuando hay demasiadas variables para mirarlas.
ISLP, Sección 12.1.
Correlaciones del bloque académico. Las materias aprobadas en 1er y 2do semestre correlacionan 0,90: quien aprueba mucho en un semestre aprueba mucho en el otro. Hay redundancia para explotar.
BLOQUE 2 DE 6
Qué es una componente principal
De la intuición en dos dimensiones al caso general.
Materias aprobadas en 1er y 2do semestre (estandarizadas). La recta negra es la primera componente: la dirección a lo largo de la cual los puntos varían más. Ella sola concentra el 95,2% de la variabilidad de las dos variables.
Ángulo: 0° — óptimo en 45°
Arrastrá el ángulo (o apretá "Girar"). Los segmentos rojos son los errores de proyección: cuando la recta llega a la primera componente, esos errores alcanzan su mínimo y, en ese mismo instante, las proyecciones quedan lo más dispersas posible.
Arrastrá para rotar, hacé zoom con la rueda. Las dos primeras componentes generan el plano que mejor se apoya sobre la nube de tres variables académicas.
Cada componente es una variable nueva, construida ponderando las originales:
Usá → para ir revelando los términos.
Los loadings describen variables; los scores describen observaciones. Es la distinción que hace legible un biplot.
Usar todas las componentes no pierde nada: es solo rotar el sistema de coordenadas. La compresión aparece cuando nos quedamos con algunas.
Aporte de cada variable al score en PC1 de un estudiante concreto: su valor estandarizado por el loading de esa variable. Las cuatro variables de materias explican casi todo el score; la nota de admisión y la edad, prácticamente nada.
A la notebook
Calcular un score a mano y comprobar que coincide con el del algoritmo.
También: rotar la recta y ver cómo cambia la varianza proyectada.
BLOQUE 3 DE 6
Leer el resultado: el biplot
Observaciones y variables, en un mismo gráfico.
Los puntos son estudiantes (scores, coloreados por desenlace — clickeá la referencia para aislar un grupo) y las flechas son variables (loadings). Pasá el mouse por el gráfico para ver los controles de zoom y explorar la zona densa cerca del origen. Las dos primeras componentes resumen el 71,5% de la variabilidad de las ocho variables.
Es el mismo tipo de lectura con la que el libro interpreta que la PC1 de USArrests mide criminalidad general.
El flujo típico en Ciencias del Comportamiento: cuestionario con muchos ítems → PCA → nombrar cada componente → relacionarla con otras variables.
BLOQUE 4 DE 6
Cuánta información conservamos
Reconstruir, medir el error y decidir cuántas componentes.
Si los scores se armaron combinando las variables, se puede hacer el camino inverso:
Usá → para ir revelando los términos.
Error cuadrático medio al reconstruir las ocho variables de los 4.424 estudiantes. Con 1 componente es 0,46; con 4 baja a 0,07; con las 8 es exactamente cero: usar todas es solo rotar los ejes.
| Componente | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 |
|---|---|---|---|---|---|---|---|---|
| PVE (%) | 54,2 | 17,3 | 12,3 | 9,5 | 3,1 | 2,1 | 1,1 | 0,4 |
| Acumulada (%) | 54,2 | 71,5 | 83,8 | 93,3 | 96,4 | 98,5 | 99,6 | 100 |
Se busca el codo: el punto donde cada componente adicional deja de aportar. Acá, 3 componentes llegan al 80% de la varianza y 4 superan el 90%.
Es la razón por la que las dos definiciones del Bloque 2, máxima varianza y mínima distancia, describen el mismo objeto.
A la notebook
Reconstruir un dato con 1, 2 y todas las componentes, y ver caer el error.
Ejercicio: cuántas componentes hacen falta para llegar al 90%.
BLOQUE 5 DE 6
Decisiones prácticas y alcance
Estandarizar, métodos no lineales y casos aplicados.
Pesos de PC1 sin escalar (izquierda) y escalando (derecha). Sin estandarizar, PC1 es casi solo la nota de admisión; estandarizando, reparte peso entre las materias y se vuelve interpretable. Salvo unidad común, se estandariza siempre.
Son los mismos estudiantes en los tres botones. PCA es lineal; al pasar a t-SNE o UMAP los mismos puntos se reacomodan y los grupos aparecen mucho más separados, porque preservan la vecindad local.
BLOQUE 6 DE 6
Supuestos y límites
Qué asume PCA, y cuándo conviene desconfiar.
Conviene igual declarar la decisión al reportar: es un supuesto que se asume, no un detalle técnico invisible.
La práctica
Aplicar PCA + clustering sobre el dataset de rotación de personal que ya conocen, para descubrir perfiles latentes de empleados.
Clusters sobre los primeros scores, y su tasa de rotación. El clustering no es robusto: cambia con la estandarización, con cuántas componentes se retienen y con $k$. Conviene repetirlo con distintas opciones y quedarse con lo que persiste.
Lo que viene: representar textos en pocas dimensiones, con embeddings (Clases 11 y 12).