Conviene haber comprendido NumPy: arrays, matrices y cálculo vectorizado.
Avanza en orden. Cada lección está redactada para Palta es Cool, utiliza ejemplos propios y termina con una actividad cuya respuesta puedes desplegar.
Ubícate antes de avanzar
Al terminar deberías poder relacionar Series y DataFrame con Limpieza y transformación y resolver un caso nuevo.
Reserva entre 75 y 120 minutos o divide el laboratorio en dos sesiones.
Instala Python 3 y utiliza IDLE o un editor como VS Code. Desde NumPy y Pandas trabaja dentro de un entorno virtual.
Abrir la guía de herramientas →Diagnóstico rápido: ¿cómo se relacionan Series y DataFrame y Limpieza y transformación? +
No necesitas acertar todavía. Escribe una hipótesis de dos líneas y compárala con tu respuesta al finalizar; si puedes corregirla y justificar el cambio, hubo aprendizaje.
Aprende el tema paso a paso
Convertirás tablas en un flujo verificable: inspeccionar, seleccionar, transformar, resumir y unir sin perder filas accidentalmente.
- Series y DataFrame combinan valores, etiquetas e índices
- Seleccionar, filtrar y crear columnas debe conservar el significado
- groupby y merge necesitan una granularidad y una clave explícitas
Series y DataFrame combinan valores, etiquetas e índices
Una Series representa una secuencia etiquetada; un DataFrame reúne columnas que pueden tener tipos distintos. Leer un archivo es solo el comienzo: primero se revisan forma, nombres, tipos, ausencias, duplicados y ejemplos.
shape informa filas y columnas.
info resume tipos y valores no nulos.
head muestra ejemplos, pero no demuestra calidad completa.
¿Por qué ver las primeras cinco filas no basta para validar un archivo?
Mostrar respuesta +
Porque errores, ausencias o categorías inesperadas pueden estar más adelante. Se necesitan conteos, tipos, rangos, unicidad y reglas del dominio.
Seleccionar, filtrar y crear columnas debe conservar el significado
loc selecciona por etiquetas y condiciones; assign o una asignación explícita crea columnas; astype y funciones de texto ayudan a normalizar. Cada paso debe justificar qué cambia y cuántas filas afecta. Los datos originales se conservan sin sobrescribir.
Usa una máscara booleana para expresar filtros.
Distingue ausencia real de cero o cadena vacía.
Compara conteos antes y después de limpiar.
¿Por qué conviene registrar cuántas filas se descartaron?
Mostrar respuesta +
Porque una limpieza puede eliminar una parte importante o sesgada de los datos. El conteo permite detectar y explicar ese efecto.
groupby y merge necesitan una granularidad y una clave explícitas
groupby divide, aplica una agregación y combina resultados. merge une tablas por claves. Antes de unir se comprueba si la clave es única en el lado esperado y después se revisan coincidencias y cantidad de filas.
Cada fila del resultado debe tener una interpretación definida.
validate en merge comprueba cardinalidades esperadas.
Un left join conserva las filas de la tabla izquierda y puede dejar ausencias.
¿Qué detecta validate="many_to_one"?
Mostrar respuesta +
Comprueba que la tabla izquierda pueda tener muchas filas por tienda, pero la derecha tenga como máximo una. Si el catálogo duplica una clave, la unión falla en vez de multiplicar filas silenciosamente.
Tu recorrido en tres ideas
- Series y DataFrame combinan valores, etiquetas e índices
- Seleccionar, filtrar y crear columnas debe conservar el significado
- groupby y merge necesitan una granularidad y una clave explícitas
Convierte ventas desordenadas en un informe verificable
Integra esquema, calidad, transformaciones, granularidad y uniones en un flujo auditable.
Dos archivos contienen ventas y clientes, con fechas mezcladas, identificadores repetidos y algunas categorías vacías.
Procedimiento
- Perfila columnas, tipos, ausencias, duplicados y claves antes de limpiar.
- Aplica reglas explícitas y registra cuántas filas cambia cada una.
- Agrupa y une declarando la cardinalidad esperada; investiga toda diferencia de conteo.
Evidencia mínima
- Reporte de calidad antes y después.
- Tabla de transformaciones con filas afectadas.
- Validación de unión y totales de control.
Mostrar razonamiento modelo +
La limpieza no es borrar lo incómodo. Se conserva el origen, se convierte con evidencia y se separan rechazos. Una unión muchos-a-uno debe demostrarse verificando la unicidad del lado derecho.
Para ir más lejos¿Qué harías si dos clientes comparten el mismo correo, pero la regla decía que era único?
Comprueba que puedes usarlo
Antes de continuar, revisa estos tropiezos frecuentes y resuelve un caso sin copiar los ejemplos.
Limpiar ausencias o duplicados sin medir qué información se elimina.
Unir tablas sin comprobar la unicidad de la clave y multiplicar filas.
Ahora hazlo sin guía
Audita ventas y clientes, corrige tipos, resume por categoría y añade los datos del cliente mediante una unión controlada.
Mostrar pauta de corrección +
- Registra forma, tipos, ausencias y duplicados antes y después.
- Cada transformación responde una regla explícita.
- Valida cardinalidad, coincidencias y número de filas de la unión.
