Trilha — Ciência de Dados

Trilha de disciplina — a ordem de leitura do livro para um curso específico.

A numeração (II.2) é parte e posição no sumário, não a ordem desta trilha. Um mesmo capítulo serve a mais de uma disciplina, e capítulos de partes distantes podem ser vizinhos aqui — é isso que permite ao livro cobrir três disciplinas sem se repetir. Ver ADR 0011.

Disciplina: Ciência de Dados · Curso: Engenharia de Software · Professor: —

Esta trilha cobre a base — a disciplina que antecede Análise Preditiva e Aprendizagem de Máquina. Serve a dois públicos: quem está cursando, e quem já cursou e precisa revisar antes das disciplinas seguintes.

Se você chegou aqui vindo de Análise Preditiva ou de Aprendizagem de Máquina e alguma coisa não fez sentido, provavelmente o que faltou está nesta trilha.

Fundamentos e ciclo

# Capítulo Cobre
1 I.1 — O Ciclo da Ciência de Dados CRISP-DM, papéis, relação entre Ciência de Dados, IA e Estatística
2 0.1 — Introdução quando ML é a resposta e quando não é

Coleta e integração

# Capítulo Cobre
3 I.2 — Coleta e Integração formatos, APIs, scraping, SQL e NoSQL, data lake e warehouse, bases públicas

Limpeza e pré-processamento

# Capítulo Cobre
4 0.2 — Fundamentos generalização, viés e variância — antes do capítulo de vazamento, que já usa overfitting e validação cruzada como se você soubesse
5 I.3 — Qualidade e Vazamento nulos, duplicatas, ficha de dataset, viés de seleção, e o vazamento
6 I.6 — Representação codificação, normalização, padronização, engenharia de atributos

Visualização e comunicação

# Capítulo Cobre
7 I.4 — Análise Exploratória estatística descritiva, dispersão, correlação, outliers
8 I.5 — Visualização e Storytelling escolha do gráfico, distorções visuais, narrativa de dados

Uma primeira passada por modelagem

# Capítulo Cobre
9 II.1 — Avaliação métricas, e por que acurácia engana
10 II.2 — Modelos Lineares o primeiro modelo, interpretável — com o laboratório de mínimos quadrados

Prática

Etapas 00 e 02 do ml-zero — linha de base, divisões honestas e a ficha de dataset como portão executável. Ambas em Python puro, sem instalar nada além do pytest.