Python · Sección 13

Pandas: preparar y analizar tablas

Series y DataFrame, importación, inspección, selección, transformación, datos faltantes, agrupación y uniones verificables.

3
lecciones
3
ejercicios resueltos
CONTENIDO ORIGINAL

Avanza en orden. Cada lección está redactada para Palta es Cool, utiliza ejemplos propios y termina con una actividad cuya respuesta puedes desplegar.

ANTES DE EMPEZAR

Ubícate antes de avanzar

01 / PUNTO DE PARTIDA

Conviene haber comprendido NumPy: arrays, matrices y cálculo vectorizado.

02 / META OBSERVABLE

Al terminar deberías poder relacionar Series y DataFrame con Limpieza y transformación y resolver un caso nuevo.

03 / TIEMPO SUGERIDO

Reserva entre 75 y 120 minutos o divide el laboratorio en dos sesiones.

04 / PREPARA EL LABORATORIO

Instala Python 3 y utiliza IDLE o un editor como VS Code. Desde NumPy y Pandas trabaja dentro de un entorno virtual.

Abrir la guía de herramientas →
Diagnóstico rápido: ¿cómo se relacionan Series y DataFrame y Limpieza y transformación?

No necesitas acertar todavía. Escribe una hipótesis de dos líneas y compárala con tu respuesta al finalizar; si puedes corregirla y justificar el cambio, hubo aprendizaje.

Ruta guiada · 3 lecciones

Aprende el tema paso a paso

Convertirás tablas en un flujo verificable: inspeccionar, seleccionar, transformar, resumir y unir sin perder filas accidentalmente.

Al terminar podrás
  • Series y DataFrame combinan valores, etiquetas e índices
  • Seleccionar, filtrar y crear columnas debe conservar el significado
  • groupby y merge necesitan una granularidad y una clave explícitas
01
Comprender la tabla

Series y DataFrame combinan valores, etiquetas e índices

Una Series representa una secuencia etiquetada; un DataFrame reúne columnas que pueden tener tipos distintos. Leer un archivo es solo el comienzo: primero se revisan forma, nombres, tipos, ausencias, duplicados y ejemplos.

01

shape informa filas y columnas.

02

info resume tipos y valores no nulos.

03

head muestra ejemplos, pero no demuestra calidad completa.

Comprueba lo aprendido · 01

¿Por qué ver las primeras cinco filas no basta para validar un archivo?

Mostrar respuesta

Porque errores, ausencias o categorías inesperadas pueden estar más adelante. Se necesitan conteos, tipos, rangos, unicidad y reglas del dominio.

02
Transformar con trazabilidad

Seleccionar, filtrar y crear columnas debe conservar el significado

loc selecciona por etiquetas y condiciones; assign o una asignación explícita crea columnas; astype y funciones de texto ayudan a normalizar. Cada paso debe justificar qué cambia y cuántas filas afecta. Los datos originales se conservan sin sobrescribir.

01

Usa una máscara booleana para expresar filtros.

02

Distingue ausencia real de cero o cadena vacía.

03

Compara conteos antes y después de limpiar.

Comprueba lo aprendido · 02

¿Por qué conviene registrar cuántas filas se descartaron?

Mostrar respuesta

Porque una limpieza puede eliminar una parte importante o sesgada de los datos. El conteo permite detectar y explicar ese efecto.

03
Resumir y combinar

groupby y merge necesitan una granularidad y una clave explícitas

groupby divide, aplica una agregación y combina resultados. merge une tablas por claves. Antes de unir se comprueba si la clave es única en el lado esperado y después se revisan coincidencias y cantidad de filas.

01

Cada fila del resultado debe tener una interpretación definida.

02

validate en merge comprueba cardinalidades esperadas.

03

Un left join conserva las filas de la tabla izquierda y puede dejar ausencias.

Comprueba lo aprendido · 03

¿Qué detecta validate="many_to_one"?

Mostrar respuesta

Comprueba que la tabla izquierda pueda tener muchas filas por tienda, pero la derecha tenga como máximo una. Si el catálogo duplica una clave, la unión falla en vez de multiplicar filas silenciosamente.

Resumen de la sección

Tu recorrido en tres ideas

  1. Series y DataFrame combinan valores, etiquetas e índices
  2. Seleccionar, filtrar y crear columnas debe conservar el significado
  3. groupby y merge necesitan una granularidad y una clave explícitas
PROFUNDIZACIÓN / LABORATORIO GUIADO

Convierte ventas desordenadas en un informe verificable

Integra esquema, calidad, transformaciones, granularidad y uniones en un flujo auditable.

CASO

Dos archivos contienen ventas y clientes, con fechas mezcladas, identificadores repetidos y algunas categorías vacías.

Procedimiento

  1. Perfila columnas, tipos, ausencias, duplicados y claves antes de limpiar.
  2. Aplica reglas explícitas y registra cuántas filas cambia cada una.
  3. Agrupa y une declarando la cardinalidad esperada; investiga toda diferencia de conteo.

Evidencia mínima

  • Reporte de calidad antes y después.
  • Tabla de transformaciones con filas afectadas.
  • Validación de unión y totales de control.
Mostrar razonamiento modelo

La limpieza no es borrar lo incómodo. Se conserva el origen, se convierte con evidencia y se separan rechazos. Una unión muchos-a-uno debe demostrarse verificando la unicidad del lado derecho.

Para ir más lejos

¿Qué harías si dos clientes comparten el mismo correo, pero la regla decía que era único?

CIERRE DE LA SECCIÓN

Comprueba que puedes usarlo

Antes de continuar, revisa estos tropiezos frecuentes y resuelve un caso sin copiar los ejemplos.

ERROR 01

Limpiar ausencias o duplicados sin medir qué información se elimina.

ERROR 02

Unir tablas sin comprobar la unicidad de la clave y multiplicar filas.

DESAFÍO INTEGRADOR

Ahora hazlo sin guía

Audita ventas y clientes, corrige tipos, resume por categoría y añade los datos del cliente mediante una unión controlada.

Mostrar pauta de corrección
Una respuesta sólida:
  • Registra forma, tipos, ausencias y duplicados antes y después.
  • Cada transformación responde una regla explícita.
  • Valida cardinalidad, coincidencias y número de filas de la unión.