Trilha — Ciência de Dados
Trilha de disciplina — a ordem de leitura do livro para um curso específico.
O número do capítulo é um identificador estável, não uma ordem. Um mesmo capítulo pode aparecer em mais de uma trilha, e capítulos de números distantes podem ser vizinhos aqui. É isso que permite ao livro cobrir três disciplinas sem se repetir.
Disciplina: Ciência de Dados · Curso: Engenharia de Software · Professor: —
Esta trilha cobre a base — a disciplina que antecede Análise Preditiva e Aprendizagem de Máquina. Serve a dois públicos: quem está cursando, e quem já cursou e precisa revisar antes das disciplinas seguintes.
Se você chegou aqui vindo de Análise Preditiva ou de Aprendizagem de Máquina e alguma coisa não fez sentido, provavelmente o que faltou está nesta trilha.
Fundamentos e ciclo
| # | Capítulo | Cobre |
|---|---|---|
| 1 | 19 — O Ciclo da Ciência de Dados | CRISP-DM, papéis, relação entre Ciência de Dados, IA e Estatística |
| 2 | 00 — Introdução | quando ML é a resposta e quando não é |
Coleta e integração
| # | Capítulo | Cobre |
|---|---|---|
| 3 | 20 — Coleta e Integração | formatos, APIs, scraping, SQL e NoSQL, data lake e warehouse, bases públicas |
Limpeza e pré-processamento
| # | Capítulo | Cobre |
|---|---|---|
| 4 | 02 — Qualidade e Vazamento | nulos, duplicatas, ficha de dataset, viés de seleção, e o vazamento |
| 5 | 03 — Representação | codificação, normalização, padronização, engenharia de atributos |
Visualização e comunicação
| # | Capítulo | Cobre |
|---|---|---|
| 6 | 21 — Análise Exploratória | estatística descritiva, dispersão, correlação, outliers |
| 7 | 22 — Visualização e Storytelling | escolha do gráfico, distorções visuais, narrativa de dados |
Uma primeira passada por modelagem
| # | Capítulo | Cobre |
|---|---|---|
| 8 | 01 — Fundamentos | generalização, viés e variância |
| 9 | 04 — Avaliação | métricas, e por que acurácia engana |
| 10 | 05 — Modelos Lineares | o primeiro modelo, interpretável — com o laboratório de mínimos quadrados |
Prática
Etapas 00 e 02 do ml-zero — linha de base, divisões honestas e a ficha de dataset como portão executável. Ambas em Python puro, sem instalar nada além do pytest.