Análisis con R · Sección 14

Bases de datos, API y formatos externos

Consultas selectivas, conexiones, JSON, paginación, caché, límites de uso y validación de fuentes externas.

3
lecciones
3
ejercicios resueltos
CONTENIDO ORIGINAL

Avanza en orden. Cada lección está redactada para Palta es Cool, utiliza ejemplos propios y termina con una actividad cuya respuesta puedes desplegar.

ANTES DE EMPEZAR

Ubícate antes de avanzar

01 / PUNTO DE PARTIDA

Conviene haber comprendido Series temporales y pronóstico.

02 / META OBSERVABLE

Al terminar deberías poder relacionar Bases de datos con API y JSON y resolver un caso nuevo.

03 / TIEMPO SUGERIDO

Reserva entre 75 y 120 minutos o divide el laboratorio en dos sesiones.

04 / PREPARA EL LABORATORIO

Instala R y luego RStudio. Conserva cada ejercicio en un proyecto separado.

Abrir la guía de herramientas →
Diagnóstico rápido: ¿cómo se relacionan Bases de datos y API y JSON?

No necesitas acertar todavía. Escribe una hipótesis de dos líneas y compárala con tu respuesta al finalizar; si puedes corregirla y justificar el cambio, hubo aprendizaje.

Ruta guiada · 3 lecciones

Aprende el tema paso a paso

Conectarás R con bases de datos y servicios web sin descargar más de lo necesario, exponiendo secretos ni confiar ciegamente en formatos externos.

Al terminar podrás
  • Filtrar cerca de los datos reduce transferencia y memoria
  • HTTP y JSON necesitan paginación, límites y manejo de errores
  • Una fuente externa debe superar controles antes de mezclarse
01
Consultar bases

Filtrar cerca de los datos reduce transferencia y memoria

DBI ofrece una interfaz común para conexiones y consultas. Se seleccionan columnas y filas necesarias, se parametrizan valores y se cierra la conexión. Las credenciales viven fuera del código.

01

Evita SELECT * en conjuntos grandes.

02

Usa parámetros, no concatenación de entradas.

03

Recolecta a R solo el resultado que realmente analizarás.

Comprueba lo aprendido · 01

¿Por qué concatenar una fecha recibida dentro del SQL es riesgoso?

Mostrar respuesta

Puede cambiar la sintaxis, producir errores o permitir inyección. Los parámetros separan datos de instrucciones y manejan conversiones correctamente.

02
Consumir una API

HTTP y JSON necesitan paginación, límites y manejo de errores

Una respuesta incluye estado, encabezados y cuerpo. La API puede paginar, limitar solicitudes o cambiar de versión. Se validan estados, se respetan pausas y se guarda una copia controlada cuando la reproducibilidad lo requiere.

01

Nunca imprimas ni confirmes tokens en el repositorio.

02

Comprueba versión, página y fecha de extracción.

03

Reintenta solo errores transitorios con espera creciente.

Comprueba lo aprendido · 02

¿Un estado HTTP 200 garantiza datos correctos?

Mostrar respuesta

No. Solo indica éxito del protocolo. El cuerpo puede tener esquema inesperado, unidades distintas, duplicados o cobertura incompleta.

03
Validar procedencia

Una fuente externa debe superar controles antes de mezclarse

Se comprueban columnas, tipos, rangos, claves, unidades, zona horaria, cobertura y frescura. La procedencia registra URL o sistema, consulta, versión, instante y transformaciones.

01

Falla con un mensaje claro ante cambios de esquema.

02

Compara conteos y totales con referencias conocidas.

03

No combines identificadores personales sin propósito y autorización.

Comprueba lo aprendido · 03

¿Guardar solo la tabla limpia basta para reproducir la extracción?

Mostrar respuesta

No. También se necesitan fuente, parámetros, fecha, versión, credenciales requeridas y transformaciones, respetando las condiciones de uso.

Resumen de la sección

Tu recorrido en tres ideas

  1. Filtrar cerca de los datos reduce transferencia y memoria
  2. HTTP y JSON necesitan paginación, límites y manejo de errores
  3. Una fuente externa debe superar controles antes de mezclarse
PROFUNDIZACIÓN / LABORATORIO GUIADO

Construye una importación que pueda reanudarse

Conecta consulta selectiva, autenticación, paginación, límites, caché y validación de esquemas.

CASO

Una API entrega diez mil registros por páginas, limita solicitudes y ocasionalmente devuelve un campo con otro tipo.

Procedimiento

  1. Guarda parámetros, página, tiempo y estado sin exponer credenciales.
  2. Valida código, contenido, esquema e identidad antes de anexar.
  3. Implementa reintento con espera, caché y reanudación desde la última página confirmada.

Evidencia mínima

  • Cantidad esperada, recibida y deduplicada.
  • Registro de páginas y errores sin secretos.
  • Copia cruda inmutable o huella verificable.
Mostrar razonamiento modelo

La robustez no consiste en repetir indefinidamente. Solo se reintentan fallos transitorios, cada página tiene identidad y el proceso puede continuar sin duplicar lo ya confirmado.

Para ir más lejos

¿Qué harías si la fuente cambia registros de páginas anteriores durante la descarga?

CIERRE DE LA SECCIÓN

Comprueba que puedes usarlo

Antes de continuar, revisa estos tropiezos frecuentes y resuelve un caso sin copiar los ejemplos.

ERROR 01

Descargar tablas completas cuando la fuente puede filtrar.

ERROR 02

Confiar en HTTP 200 sin validar esquema, unidades ni cobertura.

DESAFÍO INTEGRADOR

Ahora hazlo sin guía

Integra un resumen desde base y una API paginada conservando procedencia y controles de calidad.

Mostrar pauta de corrección
Una respuesta sólida:
  • Usa consulta parametrizada y mínima.
  • Maneja límites, errores y secretos.
  • Registra fuente, versión, fecha y validaciones.