Please enable JavaScript.
Coggle requires JavaScript to display documents.
FUNDAMENTOS DE OBTENCIÓN DE DATOS, imagen_2026-09-02_153352021, imagen…
FUNDAMENTOS DE OBTENCIÓN DE DATOS
1.1 Introducción a la obtención de datos
Obtención de datos (data adquisition) vs. adquisición, captura, recolección — distinciones terminológicas
Dato, información, conocimiento (jerarquía DIKW)
Ciclo de vida del dato en un proyecto de Ciencia de Datos
Obtención de datos como disciplina propia (vs. subordinada al modelado)
Calidad de datos: dimensiones (exactitud, completitud, consistencia, actualidad, validez)
Impacto de la calidad de datos en resultados de análisis y modelos ("garbage in, garbage out")
1.2 Fuentes de datos
Datos estructurados, semiestructurados y no estructurados
Datos primarios vs. datos secundarios
Fuentes de datos web (HTML, sitios dinámicos vs. estáticos)
APIs: definición, tipos (REST, SOAP, GraphQL)
Bases de datos relacionales y no relacionales (SQL vs. NoSQL) como fuente
Archivos planos y formatos comunes (CSV, JSON, XML, Parquet, Excel)
Sensores e IoT como fuente de datos
Datos abiertos (open data) y repositorios públicos (ej. INEGI, datos.gob.mx)
Metadatos
Arquitecturas y repositorios de almacenamiento de datos
Data Warehouse: definición y características (datos estructurados, modelados, orientados a consultas analíticas)
Data Lake: definición y características (datos crudos, sin esquema fijo, multiformato)
Data Lakehouse: concepto híbrido y motivación (unir flexibilidad del lake con estructura del warehouse)
Data Mart: subconjunto departamental/temático de un Data Warehouse
Esquema en escritura (schema-on-write) vs. esquema en lectura (schema-on-read)
Modelado dimensional básico (tablas de hechos y dimensiones) — nociones introductorias
Data Swamp (riesgo de un Data Lake mal gobernado)
Gobernanza de datos (data governance) y catálogo de datos (data catalog) — nociones introductorias
Almacenamiento en la nube vs. on-premise para estos repositorios
Tipos de procesamiento e integración de datos
ETL (Extract, Transform, Load): definición y flujo
ELT (Extract, Load, Transform): definición y diferencias frente a ETL
Criterios para elegir ETL vs. ELT (volumen, destino, capacidad de cómputo)
Pipeline de datos (data pipeline): concepto general
Procesamiento por lotes (batch processing)
Procesamiento en streaming / tiempo real (stream processing)
Procesamiento híbrido (arquitectura Lambda y arquitectura Kappa) — nociones introductorias
Orquestación de flujos de datos (concepto general, sin profundizar en herramientas específicas)
Desafíos en la obtención de datos
Volumen, velocidad, variedad, veracidad (las "V" de Big Data) aplicadas a la adquisición
Datos faltantes desde el origen
Heterogeneidad de formatos y esquemas
Limitaciones de acceso: autenticación, rate limits, paywalls
Términos de servicio y restricciones legales de las fuentes
Sesgo de muestreo (sampling bias) desde el origen de los datos
Latencia y disponibilidad de fuentes en tiempo real