Clase 1: Presentación de la asignatura e introducción al machine learning
Objetivo
Presentar la asignatura, motivar el rol del machine learning en las Ciencias del Comportamiento y establecer las bases conceptuales para el desarrollo del curso.
Contenidos
- Contexto y relevancia de la asignatura en el campo de estudio.
- Repaso del programa: temas principales, metodología de trabajo y cronograma de clases.
- Modalidad de evaluación: criterios y expectativas.
- Presentación de los objetivos generales del trabajo práctico integrador.
- Introducción al machine learning: aprendizaje a partir de datos, tipos de problemas, predicción vs. explicación.
- Articulación con Estadística para las Ciencias del Comportamiento: qué herramientas se asumen como base.
- Puesta en marcha del entorno de trabajo: Google Colab (ejecución de notebooks, celdas de código y texto, importación de librerías, carga de archivos).
- Fundamentos de Python para análisis de datos: variables y tipos, estructuras (listas, diccionarios), control de flujo (
for, condicionales) y funciones.
Todo el contenido teórico se explica a través de Nimbus, una empresa de software ficticia con un problema real de rotación de personal. El equipo de People Analytics de Nimbus corre un primer experimento (un piloto de fruta gratis en la oficina) para practicar estadística inferencial, y de ahí surge la pregunta que va a guiar buena parte del semestre: ¿se puede predecir si un empleado va a renunciar? Ese mismo caso vuelve, ampliado, en cada clase siguiente.
Notebooks
La segunda mitad de la clase es un primer contacto guiado con Python y Google Colab: no hay ejercicios para resolver todavía, es un recorrido interactivo por cargar un dataset desde una URL, correr celdas de código y texto, entender qué es una librería, y reconocer los bloques básicos de Python (variables, tipos, listas, diccionarios, condicionales, loops) usando los datos reales de Nimbus.
Los datos de Nimbus que usa la notebook se pueden descargar desde acá:
| Archivo | Contenido | Descargar |
|---|---|---|
nimbus_empleados.csv |
600 × 7: atributos estables de cada empleado (sede, área, género, educación, antigüedad, grupo del piloto de fruta) | .csv |
nimbus_salario.csv |
1.800 × 4: panel de salario mensual por empleado y año (2023-2025) | .csv |
Accedé a la notebook:
| Lenguaje | Leer en el sitio | Ejecutar en Colab | Descargar |
|---|---|---|---|
| Python (principal) | Notebook renderizada | .ipynb |
|
| R (par validado) | Notebook renderizada | .ipynb |
Las dos notebooks recorren el mismo recorrido con las mismas conclusiones: elegí el lenguaje en el que quieras trabajar. La versión Python es la del dictado; la versión R es material de referencia equivalente.
Slides
Lecturas
Obligatoria:
- James, G., Witten, D., Hastie, T., Tibshirani, R. & Taylor, J. (2023). An Introduction to Statistical Learning with Applications in Python, capítulo 1. Springer. statlearning.com (gratuito, oficial).
Complementaria (repaso de Python):
- McKinney, W. (2022). Python for Data Analysis (3ª ed.), capítulo 3: “Built-In Data Structures, Functions, and Files”. O’Reilly. wesmckinney.com/book/python-builtin (gratuito, oficial). Cubre listas, diccionarios, condicionales y loops: lo mismo que recorre la notebook, pero como material de consulta. El propio autor lo señala como el capítulo para quien nunca programó en Python. El libro vuelve en la Clase 2 (caps. 5 a 7).