Please enable JavaScript.
Coggle requires JavaScript to display documents.
BIG DATA - Coggle Diagram
BIG DATA
(Framework estruturado em 5 fases sequenciais: Question ➔ Wrangle ➔ Explore ➔ Conclusions ➔ Communicate)
4.1. Question (Perguntar / Formular)
Ponto de partida de qualquer projeto analítico.
Aprofundamento no entendimento do negócio e definição clara da dor ou hipótese.
Exemplos: "Quais são as características dos alunos que mais adquirem cursos na plataforma?" ou "Por que certos produtos sofrem sazonalidade negativa de vendas?"
4.2. Wrangle (Tratamento, Limpeza e Wrangling)
Aquisição: Extração e consolidação de múltiplas fontes.
Auditoria de Métricas: Validação se as variáveis estão sendo medidas corretamente na origem.
Saneamento: Limpeza de registros nulos, correção de tipos de dados, remoção de redundâncias e tratamento de dados corrompidos.
4.3. Explore (Análise Exploratória - EDA)
Familiarização aprofundada com os dados consolidados.
Busca de padrões visuais, distribuições, outliers e comportamentos anômalos.
Levantamento inicial de correlações entre variáveis independentes e dependentes.
4.4. Conclusions (Conclusões & Modelagem)
Extração da narrativa real contida nos dados ("contar a história dos dados").
Construção de predições com alto rigor estatístico e algoritmos de Machine Learning.
4.5. Communicate (Comunicação dos Resultados)
As descobertas só geram valor real na medida em que são transmitidas de forma compreensível aos tomadores de decisão.
Canais/Formatos: dashboards interativos, relatórios executivos, slides, artigos analíticos (blogs) e gráficos autoexplicativos.
Estrutura Cromática dos 5 Eixos:
Eixo 1 (Big Data): Laranja
Eixo 2 (BI): Azul Claro
Eixo 3 (Data Science): Roxo
Eixo 4 (Pipeline): Verde
Eixo 5 (Estatística & Gráficos): Vermelho/Rosa
🌐 Eixo 1: Cenário Atual & Big Data
1.1. Contexto e Motivação
Problema Central: O volume exponencial de dados gerados por transações e dispositivos conectados sobrecarrega sistemas tradicionais.
Citação Especialista: "Muitas soluções de ERP são antigas e não conseguem suportar o volume e o nível de detalhe exigido de dados e transações corporativas que precisam ser processadas" — Christian Hestermann (Diretor de Pesquisas do Gartner).
Transição Histórica: Passagem de sistemas de relatórios passivos para processamento em tempo hábil.
1.2. Definição Formal de Big Data
Conjuntos de dados massivos, heterogêneos e velozes que exigem arquiteturas e ferramentas especialmente preparadas para indexar, analisar e extrair inteligência tempestiva.
1.3. O Modelo dos 5 V's
📦 Volume: Terabytes, petabytes e exabytes acumulados por redes, sensores e transações contínuas.
⚡ Velocidade (Velocity): Taxa de entrada e exigência de processamento em tempo real / quase real (streaming de dados).
🔀 Variedade (Variety): Estruturados (SQL/tabelas), semiestruturados (JSON, XML, logs) e não-estruturados (vídeo, voz, imagem, texto livre).
🎯 Veracidade (Veracity): Confiabilidade, ruídos nos dados, acurácia e validação da integridade da fonte.
💎 Valor (Value): O potencial de monetização e inteligência estratégica para apoiar tomadas de decisões organizacionais.
1.4. Conectividade e Evolução Industrial
Convergência: Big Data integrado intimamente com Internet of Things (IoT) (dispositivos móveis, sensores industriais, smart devices).
Linha do Tempo das Revoluções Industriais:
Indústria 1.0 (1780 - Mecanização): Energia a vapor e água revolucionando a tração mecânica.
Indústria 2.0 (1870 - Eletrificação): Produção em massa, linhas de montagem contínua e energia elétrica.
Indústria 3.0 (1970 - Automação): Introdução da eletrônica, computadores e controladores lógicos programáveis.
Indústria 3.5 (1980 - Globalização): Deslocalização e terceirização para economias de baixo custo.
Indústria 4.0 (Atualidade - Digitalização): Dispositivos conectados (IoT), ciber-sistemas, inteligência artificial e analytics avançado.
Indústria 5.0 (Futuro - Personalização): Harmonia e cooperação homem-máquina, robôs colaborativos (Cobots) e customização em massa.
🧪 Eixo 3: Ciência de Dados (Data Science)
3.1. Fundamentação Teórica
Visão Estratégica: "Os dados, e a capacidade de extrair conhecimento útil a partir deles, devem ser considerados importantes ativos estratégicos" — Livro Data Science para Negócios.
Importância Universal: "A habilidade de obter, entender, processar, extrair valor, visualizar e se comunicar com dados vai ser extremamente importante nas próximas décadas..." — Hal Varian (Chief Economist do Google).
3.2. Contraste: BI versus Ciência de Dados
BI: Análise descritiva (o que ocorreu?); foco em métricas históricas de desempenho.
Data Science: Análise preditiva e prescritiva (o que vai acontecer? como agir?); construção de sistemas automatizados inteligentes que direcionam a ação do cliente.
3.3. Aplicações Práticas nos Setores do Mercado
💳 Serviços Financeiros: Detecção de fraudes em transações de cartão (ex.: Visa, Mastercard), pontuação de crédito (credit score), gestão de risco e análise de sentimento.
🎬 Streaming & Entretenimento: Motores de recomendação de filmes/séries (ex.: Netflix) e previsão de churn/retenção de assinantes.
🛒 E-commerce & Varejo: Seções como "produtos que você talvez goste" (ex.: Amazon), precificação dinâmica e otimização de estoque.
📱 Mídias Sociais & Marketing Digital: Reconhecimento facial, anúncios direcionados em tempo real e detecção de padrões de sentimento do usuário.
🧬 Saúde & Medicina: Tratamentos personalizados e diagnósticos preventivos por análise genética.
🛡️ Segurança da Informação: Monitoramento contínuo de pacotes de rede e detecção precoce de intrusões cibernéticas.
3.4. O Perfil Multidisciplinar do Cientista de Dados
Formado pela intersecção de três pilares fundamentais:
Engenharia de Software (TI): Desenvolvimento de software, arquitetura de sistemas, algoritmos e engenharia de dados.
Matemática e Estatística: Teoria estatística, álgebra linear, cálculo e algoritmos de Machine Learning.
Conhecimento do Domínio de Negócios: Formulação de problemas corporativos, estratégia e comunicação executiva.
Stack e Ferramental: Python (ênfase na biblioteca Pandas), bibliotecas analíticas e formulações matemáticas econométricas/estatísticas ($y_{it} = \beta' x_{it} + \mu_i + \epsilon_{it}$).
📐 Eixo 5: Estatística Aplicada & Visualização de Dados
5.1. Fundamentação
"Estatística é a ciência de obter conclusões a partir de dados" — Paul Velleman.
5.2. Medidas de Tendência Central
Média (Média Aritmética):
Somatório de todos os valores da série dividido pela contagem total ($N$).
Exemplo do Slide: Altura de 6 pessoas: $1{,}55 + 1{,}60 + 1{,}57 + 1{,}52 + 1{,}58 + 1{,}63 = 9{,}45 \div 6 = 1{,}57\text{ m}$.
Limitação: Extremamente vulnerável e distorcida por valores discrepantes (outliers).
Mediana:
Valor que divide uma distribuição ordenada exatamente ao meio (percentil 50).
Comportamento Comparativo: Muito mais robusta que a média na presença de distribuições assimétricas/distorcidas ou com outliers extremos.
5.3. Medidas de Dispersão e Resumo Numérico
Desvio Padrão ($\sigma$ ou $s$):
Mensura a regularidade ou espalhamento dos pontos em torno da média aritmética.
Baixo Desvio Padrão: Dados homogêneos e concentrados ao redor do valor esperado.
Alto Desvio Padrão: Dados heterogêneos, distribuídos ao longo de uma ampla faixa de valores.
Quartis (Q1, Q2, Q3):
Divisão da série ordenada em 4 segmentos iguais (25% cada).
$Q_1$ (25% inferiores), $Q_2$ (Mediana / 50%), $Q_3$ (75% acumulados).
Função Describe no Pandas (df.describe()):
Gera automaticamente contagem (count), média (mean), desvio padrão (std), mínimo (min), quartis (25%, 50%, 75%) e máximo (max).
5.4. Tipologia de Gráficos (Visualização)
📶 Histograma: Exibição da distribuição de frequências agrupadas em classes contínuas.
🥧 Gráfico de Pizza: Representação proporcional das partes em relação ao todo (100%).
📊 Gráfico de Barras: Comparação de grandezas quantitativas entre categorias discretas.
🌌 Gráfico de Dispersão (Scatter Plot): Avaliação de relações lineares ou não lineares entre duas variáveis contínuas.
📦 Boxplot (Diagrama de Caixa): Representação visual dos quartis, da amplitude interquartil, do valor mediano e isolamento direto de valores atípicos (outliers).
📈 Eixo 2: Business Intelligence (BI)
2.1. Definição & Propósito Central
Conceito traduzido como Inteligência Empresarial ou Inteligência de Negócios.
Objetivo: Processo sistemático que coleta e transforma dados operacionais brutos em conhecimento acionável para apoiar gestores na tomada de decisão estratégica e tática.
2.2. Pilar Temporal do BI
Foco Retrospectivo / Descritivo: Explica com exatidão o que aconteceu e por que aconteceu no passado histórico da empresa.
2.3. Processos e Componentes Metodológicos
🧹 Preparação de Dados: ETL (Extração, Transformação e Carga), padronização de medidas e dimensões analíticas.
⛏️ Mineração de Dados (Data Mining): Uso de bancos de dados, modelagem estatística e machine learning para revelar correlações ocultas em bases corporativas.
📑 Geração de Relatórios e Consultas: Respostas a queries estruturadas e relatórios para stakeholders.
📊 Benchmarking e Métricas de Desempenho: Painéis dinâmicos (Dashboards) monitorando KPIs em relação a metas organizacionais.
👁️ Visualização de Dados e Análise Visual: Storytelling com gráficos, histogramas e diagramas interativos para simplificar a absorção das informações.
Aqui está uma versão ultra detalhada e aprofundada, estruturada especificamente para cumprir todos os requisitos da atividade supervisionada (slide 53: riqueza de detalhes, definições conceituais, fórmulas, exemplos reais de aplicação e citações dos autores/especialistas presentes nos slides).
Você pode copiar este texto estruturado e usá-lo como guia de ramificação direta no Coggle (cada recuo de tabulação representa um nível/sub-ramo da árvore mental):
🧠 Fundamentos de Data Science, Big Data, BI e Estatística
(Prof. Reinaldo de Souza Júnior - SENAI / FIEG)
🔄 Eixo 4: Pipeline / Processo de Análise de Dados
🎨 Sugestões Práticas de Organização Visual no Coggle:
Imagens nos Nós: Salve as ilustrações dos slides (o diagrama dos 5 V's no slide 4, a linha do tempo industrial no slide 6, os cartões de crédito no slide 11 e o diagrama de Venn de Data Science no slide 22) e arraste-as diretamente para o nó correspondente no Coggle.