Clase 2: Análisis exploratorio y procesamiento de datos
Eje I: Procesamiento y visualización de datos en Python
Objetivo
Introducir los fundamentos de Python para el análisis de datos y explorar conceptos fundamentales del análisis exploratorio de datos en Python, articulando lo visto en Estadística e introduciendo prácticas específicas necesarias para proyectos de machine learning.
Contenidos
- Importación y exportación de datos (CSV, Excel).
- Exploración inicial: tipos de datos, estructuras comunes, estadísticos descriptivos.
- Limpieza y procesamiento de datos con pandas: filtrar, seleccionar, modificar, ordenar, renombrar, agrupar y resumir.
- Manejo de datos atípicos (outliers) y valores faltantes (missing data).
- Introducción a feature engineering: creación de variables derivadas con sentido sustantivo.
- Terminología: distinción operativa entre limpieza, procesamiento, preprocesamiento, feature engineering y feature selection (ver Apéndice del programa).
La clase toma las tres tablas de Nimbus, la empresa de la Clase 1, y las deja en una sola tabla lista para analizar. El recorrido son cinco pasos —cargar, explorar, estructurar, limpiar y enriquecer— y termina reconstruyendo, desde los archivos, el mismo efecto del piloto de fruta que en la Clase 1 apareció como un gráfico ya cocinado.
Sobre el final se presenta HR Employee Attrition, el dataset que acompaña al resto de la materia, y se aplica sobre él el mismo recorrido.
Notebooks
La notebook es la clase práctica: la recorremos juntos en Colab, y en cada uno de los cinco pasos hay una consigna corta para resolver en el momento. Son ocho en total, contando las tres del ejercicio de cierre.
Los cuatro archivos de datos
La notebook usa cuatro archivos. Bajalos desde acá:
| Archivo | Contenido | Descargar |
|---|---|---|
nimbus_empleados.csv |
600 × 7: atributos estables de cada empleado (sede, área, género, educación, antigüedad, grupo del piloto de fruta) | .csv |
nimbus_salario.csv |
1.800 × 4: panel de salario mensual por empleado y año (2023-2025) | .csv |
nimbus_bienestar_diario.csv |
24.000 × 5: panel diario de bienestar (escala 1-7) durante el piloto de fruta | .csv |
hr_attrition.csv |
1.470 × 35: empleados de IBM, con Attrition (si la persona dejó la empresa). Se usa en el ejercicio de cierre y vuelve en casi todas las clases siguientes |
.csv |
hr_attrition.csv: renombralo al bajarlo
Los tres archivos de Nimbus se bajan de este sitio y ya vienen con el nombre correcto.
El cuarto no: se descarga del repositorio oficial de IBM, donde el archivo se llama emp_attrition.csv. Renombralo a hr_attrition.csv antes de subirlo al Drive, porque es el nombre con el que la notebook lo busca.
Si el navegador te lo abre como texto en vez de bajarlo, usá clic derecho → Guardar enlace como…
Accedé a la notebook:
| Lenguaje | Leer en el sitio | Ejecutar en Colab | Descargar |
|---|---|---|---|
| Python (principal) | Notebook renderizada | .ipynb |
|
| R (par validado) | Notebook renderizada | .ipynb |
Las dos notebooks recorren el mismo análisis con las mismas conclusiones, y dan exactamente los mismos números: elegí el lenguaje en el que quieras trabajar. La versión Python es la del dictado; la versión R es material de referencia equivalente.
Las dos notebooks leen los datos desde tu Google Drive, en la carpeta MyDrive/analitica_de_datos/clase_02/. Bajá los cuatro archivos de la tabla de arriba y subilos ahí antes de la clase. La carpeta te tiene que quedar así:
MyDrive/analitica_de_datos/clase_02/
├── nimbus_empleados.csv
├── nimbus_salario.csv
├── nimbus_bienestar_diario.csv
└── hr_attrition.csv
En Python el Drive se monta solo: la primera celda lo hace y Colab te pide permiso.
En R hay que montarlo a mano, una sola vez: en el panel de la izquierda, el icono de carpeta, y ahí “Activar Drive”. Si no lo hacés, la celda que carga el archivo va a decir que no existe.
El dataset que acompaña al resto de la materia
HR Employee Attrition (IBM): 1.470 empleados, 35 variables, y una columna objetivo, Attrition, que dice si la persona dejó la empresa. Aparece en el ejercicio de cierre de esta clase y vuelve en casi todas las siguientes.
Igual que los de Nimbus, las notebooks lo leen desde tu Drive, así que tiene que estar en MyDrive/analitica_de_datos/clase_02/ con el nombre hr_attrition.csv. El enlace de descarga está en la tabla de arriba y apunta al repositorio oficial de IBM, IBM/employee-attrition-aif360, que es la fuente que este sitio no redistribuye por su licencia.
Slides
Lecturas
Obligatoria:
- McKinney, W. (2022). Python for Data Analysis (3ª ed.), capítulos 5 a 7. O’Reilly. wesmckinney.com/book (gratuito, oficial). El capítulo 5 presenta las estructuras de pandas, el 6 la carga de archivos y el 7 la limpieza y preparación: es exactamente el recorrido de la clase, con más detalle.
Complementaria (referencia en R):
- Wickham, H. & Grolemund, G. (2017). R para Ciencia de Datos, capítulos 4 a 6. O’Reilly. es.r4ds.hadley.nz (gratuito, en español).