Please enable JavaScript.
Coggle requires JavaScript to display documents.
Fundamentos de Obtención de Datos - Coggle Diagram
Fundamentos de Obtención de Datos
Introducción a la obtención de datos
• Calidad de datos (5 dimensiones)
Exactitud, Completitud, Consistencia, Actualidad, Validez
• Obtención como disciplina propia
Pregunta central: ¿qué proceso generó los datos?
Vs Modelado: ¿qué función se ajusta mejor?
Principio clave: mal diseño de captura → ningún modelo lo arregla
• Ciclo de vida del dato
Generación → Captura → Almacenamiento → Procesamiento → Análisis → Visualización → Implementación → Archivo
• Principio GIGO: "Entrada basura → salida basura"
• Jerarquía DIKW
Dato: hecho aislado
Información: datos organizados con contexto
Conocimiento: interpretación y comprensión
Sabiduría: decisión basada en conocimiento
• Distinciones terminológicas
Obtención: integración hacia infraestructura de análisis
Captura: detección en tiempo real de eventos
Recolección: diseño de método para datos nuevos
Fuentes de datos
Por estructura
Estructurados: tablas, SQL, CSV, Excel
Semiestructurados: JSON, XML
No estructurados: texto, imágenes, audio, video
Por origen
Primarios: recolectados por ti, control total, mayor costo
Secundarios: ya existentes, menor costo, sin control
• Tipos específicos
Web estática / dinámica
APIs: REST, SOAP, GraphQL
Bases de datos: SQL vs NoSQL
Archivos planos: CSV, JSON, XML, Parquet, Excel
Sensores / IoT: captura física en tiempo real
Datos abiertos: INEGI, datos.gob.mx
Metadatos: información que describe el dato
APIs
REST: Usa HTTP, simple y extendida.
SOAP: Mensajes XML, mayor formalidad y seguridad.
GraphQL: Solicita solo los datos necesarios.
Bases de datos
Relacionales (SQL): Tablas, esquema rígido, relaciones.
NoSQL: Esquema flexible, formatos variados.
Archivos planos
CSV → tabulares simples; JSON → jerárquico; XML → estructurado empresarial; Parquet → big data eficiente; Excel → análisis manual.
ARQUITECTURAS Y REPOSITORIOS DE ALMACENAMIENTO
Data Warehouse
Datos estructurados, limpios, organizados.
Optimizado para consultas analíticas (OLAP).
Esquema definido antes de almacenar.
Data Lake
Datos crudos, sin procesar, multiformato.
Sin esquema fijo; se define al analizar.
Riesgo: Data Swamp → sin gobierno se vuelve inutilizable.
Data Lakehouse
Híbrido: flexibilidad del Lake + estructura y fiabilidad del Warehouse.
Evita silos de información.
Data Mart
Subconjunto departamental/temático de un Data Warehouse.
Más rápido y sencillo para su área específica.
Esquemas
Schema-on-Write: Estructura antes de guardar (Warehouse).
Schema-on-Read: Estructura al consultar (Lake).
Modelado dimensional
Tabla de hechos: Medidas, métricas, cantidades.
Tablas de dimensión: Contexto (fecha, lugar, producto, cliente).
• Gobernanza y Catálogo de Datos
Gobernanza: reglas, roles, responsabilidades
Catálogo: inventario y buscador de datos
• Almacenamiento: Nube vs On-premise
Procesamiento e integración
• ETL vs ELT
ETL: Extrae → Transforma → Carga (antes de guardar)
ELT: Extrae → Carga → Transforma (después de guardar)
• Procesamiento
Por lotes: acumulado por periodos
En streaming: al llegar, tiempo real
• Arquitecturas híbridas
Lambda: capa batch + capa velocidad
Kappa: todo como flujo continuo
• Orquestación: coordinación automatizada de flujos
Desafíos en la obtención
Las 4 V del Big Data
Volumen, Velocidad, Variedad, Veracidad
Problemas comunes
Datos faltantes desde el origen
Heterogeneidad de formatos y esquemas
Limitaciones de acceso: autenticación, límites, muros de pago
Restricciones legales y licencias
Sesgo de muestreo desde la fuente
Escalabilidad
Vertical: más recursos en una máquina (límite físico)
Horizontal: más máquinas distribuidas (sin límite)
• Latencia y disponibilidad