Clase 2: Análisis exploratorio y procesamiento de datos

Eje I: Procesamiento y visualización de datos en Python

Objetivo

Introducir los fundamentos de Python para el análisis de datos y explorar conceptos fundamentales del análisis exploratorio de datos en Python, articulando lo visto en Estadística e introduciendo prácticas específicas necesarias para proyectos de machine learning.

Contenidos

  • Importación y exportación de datos (CSV, Excel).
  • Exploración inicial: tipos de datos, estructuras comunes, estadísticos descriptivos.
  • Limpieza y procesamiento de datos con pandas: filtrar, seleccionar, modificar, ordenar, renombrar, agrupar y resumir.
  • Manejo de datos atípicos (outliers) y valores faltantes (missing data).
  • Introducción a feature engineering: creación de variables derivadas con sentido sustantivo.
  • Terminología: distinción operativa entre limpieza, procesamiento, preprocesamiento, feature engineering y feature selection (ver Apéndice del programa).
NotaSeguimos con Nimbus

La clase toma las tres tablas de Nimbus, la empresa de la Clase 1, y las deja en una sola tabla lista para analizar. El recorrido son cinco pasos —cargar, explorar, estructurar, limpiar y enriquecer— y termina reconstruyendo, desde los archivos, el mismo efecto del piloto de fruta que en la Clase 1 apareció como un gráfico ya cocinado.

Sobre el final se presenta HR Employee Attrition, el dataset que acompaña al resto de la materia, y se aplica sobre él el mismo recorrido.

Notebooks

La notebook es la clase práctica: la recorremos juntos en Colab, y en cada uno de los cinco pasos hay una consigna corta para resolver en el momento. Son ocho en total, contando las tres del ejercicio de cierre.

Los cuatro archivos de datos

La notebook usa cuatro archivos. Bajalos desde acá:

Archivo Contenido Descargar
nimbus_empleados.csv 600 × 7: atributos estables de cada empleado (sede, área, género, educación, antigüedad, grupo del piloto de fruta) .csv
nimbus_salario.csv 1.800 × 4: panel de salario mensual por empleado y año (2023-2025) .csv
nimbus_bienestar_diario.csv 24.000 × 5: panel diario de bienestar (escala 1-7) durante el piloto de fruta .csv
hr_attrition.csv 1.470 × 35: empleados de IBM, con Attrition (si la persona dejó la empresa). Se usa en el ejercicio de cierre y vuelve en casi todas las clases siguientes .csv
Advertenciahr_attrition.csv: renombralo al bajarlo

Los tres archivos de Nimbus se bajan de este sitio y ya vienen con el nombre correcto.

El cuarto no: se descarga del repositorio oficial de IBM, donde el archivo se llama emp_attrition.csv. Renombralo a hr_attrition.csv antes de subirlo al Drive, porque es el nombre con el que la notebook lo busca.

Si el navegador te lo abre como texto en vez de bajarlo, usá clic derecho → Guardar enlace como…

Accedé a la notebook:

Lenguaje Leer en el sitio Ejecutar en Colab Descargar
Python (principal) Notebook renderizada Open in Colab .ipynb
R (par validado) Notebook renderizada Open in Colab .ipynb
Tip

Las dos notebooks recorren el mismo análisis con las mismas conclusiones, y dan exactamente los mismos números: elegí el lenguaje en el que quieras trabajar. La versión Python es la del dictado; la versión R es material de referencia equivalente.

ImportanteAntes de empezar: subí los archivos a tu Drive

Las dos notebooks leen los datos desde tu Google Drive, en la carpeta MyDrive/analitica_de_datos/clase_02/. Bajá los cuatro archivos de la tabla de arriba y subilos ahí antes de la clase. La carpeta te tiene que quedar así:

MyDrive/analitica_de_datos/clase_02/
├── nimbus_empleados.csv
├── nimbus_salario.csv
├── nimbus_bienestar_diario.csv
└── hr_attrition.csv

En Python el Drive se monta solo: la primera celda lo hace y Colab te pide permiso.

En R hay que montarlo a mano, una sola vez: en el panel de la izquierda, el icono de carpeta, y ahí “Activar Drive”. Si no lo hacés, la celda que carga el archivo va a decir que no existe.

El dataset que acompaña al resto de la materia

HR Employee Attrition (IBM): 1.470 empleados, 35 variables, y una columna objetivo, Attrition, que dice si la persona dejó la empresa. Aparece en el ejercicio de cierre de esta clase y vuelve en casi todas las siguientes.

Igual que los de Nimbus, las notebooks lo leen desde tu Drive, así que tiene que estar en MyDrive/analitica_de_datos/clase_02/ con el nombre hr_attrition.csv. El enlace de descarga está en la tabla de arriba y apunta al repositorio oficial de IBM, IBM/employee-attrition-aif360, que es la fuente que este sitio no redistribuye por su licencia.

Slides

Diapositivas de la clase

Lecturas

Obligatoria:

  • McKinney, W. (2022). Python for Data Analysis (3ª ed.), capítulos 5 a 7. O’Reilly. wesmckinney.com/book (gratuito, oficial). El capítulo 5 presenta las estructuras de pandas, el 6 la carga de archivos y el 7 la limpieza y preparación: es exactamente el recorrido de la clase, con más detalle.

Complementaria (referencia en R):

  • Wickham, H. & Grolemund, G. (2017). R para Ciencia de Datos, capítulos 4 a 6. O’Reilly. es.r4ds.hadley.nz (gratuito, en español).