Please enable JavaScript.
Coggle requires JavaScript to display documents.
Unidad 1: Fundamentos de obtención de datos - Coggle Diagram
Unidad 1: Fundamentos de obtención de datos
1.1 Introducción a la obtención de datos
Obtención vs. captura vs. recolección de datos
Jerarquía DIKW (Dato → Información → Conocimiento → Sabiduría)
Ciclo de vida del dato en un proyecto de Ciencia de Datos
Generación → Captura → Almacenamiento → Procesamiento → Análisis → Visualización → Implementación → Archivo
Obtención de datos como disciplina propia
Muestreo en encuestas y censos
Instrumentación científica y sensores
Ensayos clínicos
Calidad de datos: dimensiones
Garbage in, garbage out (impacto de la calidad en resultados)
1.2 Fuentes de datos
Datos estructurados, semiestructurados y no estructurados
Datos primarios vs. secundarios
Fuentes de datos web (sitios estáticos vs. dinámicos)
APIs
REST
SOAP
GraphQL
Bases de datos relacionales vs. NoSQL
Archivos planos (CSV, JSON, XML, Parquet, Excel)
Sensores e IoT
Datos abiertos y repositorios públicos (INEGI, datos.gob.mx)
Metadatos
Origen y linaje
Estructura y semántica
Condiciones de uso
Contexto de generación
Arquitecturas y repositorios de almacenamiento
Data Warehouse (estructurado, modelado, OLAP)
Data Lake (crudo, sin esquema, multiformato)
Data Lakehouse (híbrido lake + warehouse)
Data Mart (subconjunto departamental)
Schema-on-write vs. schema-on-read
Modelado dimensional (tablas de hechos y dimensiones)
Data Swamp (riesgo de lake mal gobernado)
Gobernanza de datos y catálogo de datos
Almacenamiento en la nube vs. on-premise
Tipos de procesamiento e integración de datos
ETL (Extract, Transform, Load)
ELT (Extract, Load, Transform)
Criterios ETL vs. ELT (volumen, destino, cómputo)
Pipeline de datos
Procesamiento por lotes (batch)
Procesamiento en streaming (tiempo real)
Procesamiento híbrido
Arquitectura Lambda
Arquitectura Kappa
Orquestación de flujos de datos
Desafíos en la obtención de datos
Las 4 V del Big Data (volumen, velocidad, variedad, veracidad)
Datos faltantes desde el origen
Heterogeneidad de formatos y esquemas
Limitaciones de acceso (autenticación, rate limits, paywalls)
Términos de servicio y restricciones legales
Sesgo de muestreo desde el origen
Escalabilidad y almacenamiento de datos adquiridos
Latencia y disponibilidad de fuentes en tiempo real