# I.1 — O Ciclo da Ciência de Dados

> **Estado da arte capturado em 2026-08** · última revisão 2026-08-08 · [histórico](../HISTORICO.md)
>
> **Nível: essencial.** Corpo escrito e prática funcionando; o aprofundamento (experimento próprio, todas as fontes conferidas, cláusula de expiração) vem em ciclo próprio — ver [níveis de maturidade](../GUIA-EDITORIAL.md#niveis-de-maturidade).

## Objetivos de aprendizagem

- **O1.** Descrever as seis fases do CRISP-DM e o que cada uma entrega.
- **O2.** Justificar por que entendimento de negócio vem antes de qualquer dado.
- **O3.** Reconhecer que o ciclo é iterativo, e não uma cascata.
- **O4.** Distinguir os papéis de cientista de dados, engenheiro de dados e engenheiro de ML.

## O problema: um modelo excelente para a pergunta errada

Um varejista pede um modelo de *churn* — de abandono: prever quem vai deixar de comprar. A equipe recebe acesso ao banco, encontra a tabela de compras, define o rótulo pelo que os dados permitem ("cliente que não compra há 90 dias"), treina, mede e entrega AUC de 0,93. O relatório é bonito. O modelo nunca foi usado.

O motivo apareceu na primeira reunião com a área de retenção: eles só conseguem agir sobre um cliente **na renovação do plano**, e a renovação acontece antes dos 90 dias de silêncio. Quando o modelo acusa risco, o cliente já foi embora. A lista chega tarde para todo mundo que poderia fazer algo com ela.

Nenhuma métrica do [capítulo II.1](ii-1-avaliacao.md) capturaria isso. O modelo é bom; o alvo é que responde a uma pergunta que ninguém tinha. E repare no mecanismo do erro: a equipe começou **pelos dados disponíveis**, e o rótulo saiu do que era fácil de calcular, não do que era possível decidir.

:::lab {"id":"ciclo-ciencia-de-dados-l1","tipo":"anima-horizonte","titulo":"A AUC sobe, a lista chega tarde"}
Mil e duzentos clientes. O horizonte do rótulo desliza de 5 a 120 dias de silêncio, e duas curvas aparecem juntas: em **azul**, a AUC do modelo; em **vermelho**, a fração dos clientes marcados que **ainda dá para acionar** quando o alarme toca, dado que cada um decide a renovação na data dele.

Assista as duas. Elas andam em sentidos opostos.

A AUC sobe de 0,66 para **0,76**, e sobe por um motivo legítimo: cliente calado há quatro meses é fácil de prever. É esta curva que vai para o relatório, e é ela que faz a equipe do capítulo escolher os 90 dias. Do outro lado, a fração acionável cai até **0,000**: no horizonte longo, todo mundo que o modelo aponta já passou da própria renovação.

**O produto das duas tem máximo no meio.** Com a renovação caindo em média no dia 60, o melhor valor aparece no horizonte de **23 dias** — muito antes do ponto onde a AUC é melhor.

Agora clique em **"E se a renovação fosse no dia 30?"**. Nada no modelo mudou, nada nos dados mudou. O ótimo vai para **11 dias**.

> **É a tese do capítulo em dois números.** O horizonte certo não sai da tabela, sai do **prazo da operação** — e quando o prazo muda, o rótulo tem de mudar junto, mesmo que os dados sejam exatamente os mesmos. A curva azul não sabe disso e nunca vai saber, porque a AUC não tem como perguntar quando a decisão pode ser tomada. É por isso que o entendimento do negócio é a fase 1, e não uma conversa que se tem depois de o modelo ficar pronto.
:::

O CRISP-DM (*CRoss-Industry Standard Process for Data Mining*) existe para tornar esse erro difícil de cometer. Ele coloca *entendimento do negócio* como fase 1 e *modelagem* como fase 4 — e essa ordem é a lição inteira do capítulo.

## De onde isto veio

**O aperto.** Meados dos anos 1990. Mineração de dados era um mercado novo, com dinheiro entrando e nenhum acordo sobre como se trabalha. Cada projeto reinventava seu próprio processo. Dois times na mesma empresa entregavam relatórios que não se comparavam; duas empresas não conseguiam repetir o que a outra tinha feito. Não havia como saber se um resultado ruim veio do problema, dos dados ou de alguém ter pulado uma etapa — porque não existia a lista de etapas.

**O que se fazia antes.** Consultoria: cada casa trazia seu método interno, não publicado, casado com a ferramenta que vendia. E ferramenta se vendia sem método nenhum. Comprava-se o *workbench*, o pacote que reunia as ferramentas de mineração numa tela só, e o cliente que descobrisse sozinho o que fazer com ele.

**A virada.** Escrever um processo **de indústria**, e não de fornecedor. Seis fases explicitamente **cíclicas**, com *entendimento do negócio* na primeira posição e *modelagem* apenas na quarta. O documento não pertence a ninguém, não exige software algum e descreve entregas, não cliques.

**A ideia reaproveitável.** **O método é o produto, não a ferramenta.** Quando um campo novo ainda não tem processo comum, o processo comum vale mais do que qualquer algoritmo: é ele que torna o resultado auditável (dá para perguntar em que fase a coisa desandou) e transferível (outra equipe consegue continuar o trabalho). Vale para muito além de mineração de dados — é a mesma razão pela qual um repositório com README, testes e CI vale mais que um repositório com código mais esperto.

**O nome.** *CRoss-Industry Standard Process for Data Mining*. O "cross-industry" não é enfeite, é a tese: o processo não pode pertencer a um setor nem a um vendedor, ou volta a ser método de consultoria.

O prefácio do guia conta a origem em primeira pessoa. **Concebido no fim de 1996** por três veteranos de um mercado que os próprios autores chamam de jovem e imaturo, virou consórcio no ano seguinte: *"A year later we had formed a consortium, invented an acronym (CRoss-Industry Standard Process for Data Mining), obtained funding from the European Commission and begun to set out our initial ideas."*

O consórcio tem **quatro** membros, e a página de propriedade do documento os lista: NCR, DaimlerChrysler (então Daimler-Benz), SPSS (então ISL, autora do Clementine, *"the first commercial data mining workbench"*, de 1994) e a seguradora holandesa OHRA. Foi testado em projetos reais na Mercedes-Benz e na OHRA, e a versão 1.0 saiu em 1999 ([guia CRISP-DM 1.0](https://www.kde.cs.uni-kassel.de/lehre/ws2012-13/kdd/files/CRISPWP-0800.pdf)).

Olhe outra vez para a lista do consórcio: uma **montadora** e uma **seguradora** sentadas na mesma mesa. A prova de conceito do "cross-industry" está na composição do grupo — se o mesmo processo servisse para fabricar carros e para precificar apólices, servia para o resto.

> **A restrição material gerou a forma.** O CRISP-DM não é fruto de uma boa ideia solta: é resposta a um mercado sem linguagem comum. O livro já viu isso duas vezes — no [capítulo I.5](i-5-visualizacao-storytelling.md), Playfair inventa o gráfico de barras porque **não tinha** a série temporal que os outros gráficos exigiam; no [capítulo III.1](iii-1-neuronio-artificial.md), o neurônio de 1943 nasce sem aprendizado porque não havia como treinar coisa alguma. Falta de recurso é o que mais produz forma nova.

**Procedência das afirmações desta seção:**

| Selo | Afirmação |
|---|---|
| ✓ | A estrutura de **seis fases** e o nome por extenso, no texto do [guia CRISP-DM 1.0](https://www.kde.cs.uni-kassel.de/lehre/ws2012-13/kdd/files/CRISPWP-0800.pdf) (78 páginas, PDF extraído e lido): *"The life cycle of a data mining project consists of six phases"*, e a expansão do acrônimo tal como o prefácio a registra |
| ✓ | A cronologia e o consórcio, pelo prefácio e pela página de propriedade do mesmo guia: concepção no fim de 1996, consórcio e financiamento **da Comissão Europeia** um ano depois, versão 1.0 em 1999; os quatro membros (NCR, DaimlerChrysler, SPSS, OHRA); os testes na Mercedes-Benz e na OHRA; e o Clementine de 1994 como *"the first commercial data mining workbench"* |
| ⏳ | Que o financiamento europeu tenha vindo especificamente do programa **ESPRIT**. É a atribuição corrente, e **a palavra não aparece nenhuma vez no guia**, que diz apenas "European Commission" |
| ❌ | **Correção de 2026-08-13.** Este capítulo afirmava um consórcio de **cinco** organizações, incluindo a Teradata como membro e a ISL separada da SPSS. Ler o guia desfez as duas: a Teradata é a linha de *data warehouse* **da NCR**, citada no prefácio como o negócio que motivou a participação dela, e ISL é o nome anterior da própria SPSS |
| ⏳ | O estado do mercado em meados dos anos 1990: processo ad hoc por consultoria, ferramenta vendida sem método, resultados não comparáveis nem repetíveis entre empresas |
| ⏳ | Que a presença de uma seguradora ao lado de uma montadora funcione como prova de conceito do "cross-industry" |
| 📖 | A ideia reaproveitável ("o método é o produto, não a ferramenta") e a leitura de que o processo comum é o que torna o resultado auditável e transferível |

## Fundamentos: as seis fases e o que cada uma entrega

Uma fase não termina quando o tempo acaba — termina quando ela **entrega** o artefato que a fase seguinte consome.

| # | Fase | A pergunta que ela responde | O que entrega |
|---|---|---|---|
| 1 | **Entendimento do negócio** | que decisão vai mudar, de quem, e quando? | objetivo de negócio, critério de sucesso, restrição de ação |
| 2 | **Entendimento dos dados** | o que existe, e dá para confiar? | inventário das fontes, primeiras estatísticas, problemas de qualidade |
| 3 | **Preparação dos dados** | como isto vira uma tabela treinável? | conjunto de treino/teste, atributos, rótulo definido |
| 4 | **Modelagem** | que família de modelo, com que hiperparâmetros? | modelos treinados e seus resultados técnicos |
| 5 | **Avaliação** | isto resolve o problema da fase 1? | decisão de seguir, iterar ou parar |
| 6 | **Implantação** | como isto chega a quem decide, e continua funcionando? | sistema em produção, monitoramento, plano de manutenção |

Três fases já têm capítulo próprio neste livro. A **preparação dos dados** é o assunto do [capítulo I.3](i-3-dados.md) e do [capítulo I.2](i-2-coleta-integracao.md). A **avaliação** técnica, com matriz de confusão e métrica escolhida pelo custo do erro, é o [capítulo II.1](ii-1-avaliacao.md). A **implantação** é o [capítulo V.2](v-2-sistemas-de-ml.md) e o [capítulo V.3](v-3-mlops.md).

E vale separar duas coisas que o vocabulário mistura. A métrica que você calcula dentro da fase 4 responde *"o modelo aprendeu?"*. A fase 5 responde *"e daí?"* — se o ganho de AUC vira dinheiro, se a lista chega a tempo de alguém agir, se o critério escrito na fase 1 foi atingido. Um modelo pode passar na primeira e reprovar na segunda. Foi exatamente o que aconteceu com o *churn* do início do capítulo.

:::exercicio {"id":"ciclo-ciencia-de-dados-e1","tipo":"multipla","objetivo":"O2","dificuldade":"media"}
Uma seguradora pede um modelo para "reduzir os sinistros de automóvel". O projeto tem seis semanas. O que o CRISP-DM manda fazer na primeira?

- [ ] Levantar as tabelas disponíveis no *data warehouse* e medir a qualidade de cada campo.
- [ ] Descobrir qual decisão vai mudar por causa do modelo, quem a toma e com quanta antecedência.
- [ ] Treinar um modelo simples de linha de base, para saber se o problema tem sinal.
- [ ] Definir a métrica de avaliação e separar o conjunto de teste.

> **volte para:** #o-problema-um-modelo-excelente-para-a-pergunta-errada
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"ciclo-ciencia-de-dados-e6","tipo":"multipla","objetivo":"O1","dificuldade":"facil"}
"Conjunto de treino e teste, atributos e rótulo definido." Qual fase do CRISP-DM entrega esse artefato?

- [ ] Fase 2, entendimento dos dados.
- [ ] Fase 3, preparação dos dados.
- [ ] Fase 4, modelagem.
- [ ] Fase 5, avaliação.

> **volte para:** #fundamentos-as-seis-fases-e-o-que-cada-uma-entrega
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"ciclo-ciencia-de-dados-e7","tipo":"multipla-multi","objetivo":"O1","dificuldade":"media"}
Um relatório de projeto lista o que a equipe produziu nas duas primeiras semanas. Quais itens são entrega da **fase 1**, e não de outra fase? (marque todos que valem)

- [ ] "Critério de sucesso: reduzir de 12 para 5 copos o erro médio de preparo diário."
- [ ] "A dona decide a quantidade às 7h, antes de conhecer o movimento do dia."
- [ ] "A coluna de temperatura vai de 15 a 103, sem unidade declarada."
- [ ] "Objetivo: decidir quanta limonada preparar, para não sobrar nem faltar."
- [ ] "Foram construídas 14 variáveis derivadas do calendário."

> **volte para:** #fundamentos-as-seis-fases-e-o-que-cada-uma-entrega
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"ciclo-ciencia-de-dados-e8","tipo":"multipla","objetivo":"O2","dificuldade":"dificil"}
Um colega objeta: "não dá para conversar com o negócio antes de olhar os dados, porque não sabemos o que é possível prometer". Qual é a melhor avaliação dessa objeção?

- [ ] Está errada: a fase 1 é primeira, e a ordem do CRISP-DM não admite exceção.
- [ ] Está certa: por isso o ciclo deve começar pela fase 2 sempre que a equipe não conhece o domínio.
- [ ] Tem uma parte certa, e ela é atendida por uma volta rápida da fase 2 para a fase 1 — não por inverter a ordem de partida.
- [ ] É irrelevante: viabilidade técnica se descobre na fase 4, não na 2.

> **volte para:** #as-setas-voltam-por-que-isto-e-um-ciclo-nao-uma-cascata
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"ciclo-ciencia-de-dados-e4","tipo":"aberta","objetivo":"O2","pontos":3,"dificuldade":"media"}
**Fase 1 — Entendimento do negócio.** *Que decisão vai mudar, de quem, e quando?*

Uma barraca de limonada guarda, há um ano, o registro diário de tempo, panfletos distribuídos, preço praticado e copos vendidos. A dona quer "usar os dados para vender mais".

Escreva os **três artefatos** que a fase 1 tem de entregar antes de alguém abrir a planilha:

1. o **objetivo de negócio** (não o objetivo técnico);
2. o **critério de sucesso**, com um número ou um limiar que dê para verificar depois;
3. a **restrição de ação** — o que a dona **consegue** mudar, com que antecedência.

> **Objetivo de negócio:** "decidir quanta limonada preparar por dia, para não sobrar nem faltar". Repare que não há a palavra "modelo" — a fase 1 fala a língua de quem decide.
>
> **Critério de sucesso:** "errar a quantidade preparada em menos de 5 copos na maioria dos dias, contra os 12 copos de erro médio de hoje". Traz número e traz comparação com o que já existe: sem linha de base, "melhor" não quer dizer nada (capítulo 0.2).
>
> **Restrição de ação:** ela decide quanto preparar **de manhã**, antes de saber o movimento do dia. Isso muda tudo — a previsão tem de estar pronta **antes**, e só pode usar o que se sabe de manhã. Uma previsão que usa o número de panfletos efetivamente distribuídos durante o dia é inútil para decidir de manhã, por mais precisa que seja.
>
> É o mesmo erro do *churn* do começo do capítulo: o modelo acertava, e a informação chegava depois da hora de agir.
> **volte para:** #fundamentos-as-seis-fases-e-o-que-cada-uma-entrega
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"ciclo-ciencia-de-dados-e5","tipo":"aberta","objetivo":"O1","pontos":3,"dificuldade":"media"}
**Fase 2 — Entendimento dos dados.** *O que existe, e dá para confiar?*

O registro da barraca tem 365 linhas e sete colunas: `data`, `dia_semana`, `temperatura`, `precipitacao`, `panfletos`, `preco`, `vendas`. Nenhum valor faltante.

Entregue as **três** coisas que a fase 2 exige:

1. o **inventário**: o que cada coluna é e, na pergunta que separa a fase 2 da fase 3, **quais delas você teria em mãos no momento de decidir**;
2. as **primeiras estatísticas** que você pediria antes de qualquer modelo, e o que cada uma responderia;
3. pelo menos **dois problemas de qualidade ou de confiança** que você iria procurar neste conjunto específico.

> **volte para:** #fundamentos-as-seis-fases-e-o-que-cada-uma-entrega
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

## As setas voltam: por que isto é um ciclo, não uma cascata

O desenho do CRISP-DM tem setas entre fases vizinhas **e setas de volta**. Elas não são decoração de diagrama: são as quatro descobertas que todo projeto faz fora de ordem.

- **Fase 2 → fase 1.** Você abre os dados e descobre que a pergunta não é respondível: o campo que definiria o alvo só existe a partir de 2024, ou é preenchido à mão em 30% dos casos. A pergunta precisa mudar antes que qualquer coisa seja treinada.
- **Fase 4 → fase 3.** O laço mais frequente do ciclo. Todo erro que o modelo comete devolve trabalho para a preparação — um atributo novo, um vazamento a tapar, um recorte de amostra a corrigir.
- **Fase 5 → fase 1.** O modelo funciona e não serve: chega tarde, prevê o que ninguém pode acionar, ou o ganho não paga o custo operacional.
- **Fase 6 → tudo.** Em produção, o mundo muda debaixo do modelo — comportamento, catálogo, política de preço. É o *drift* do [capítulo V.3](v-3-mlops.md), e é a razão de o CRISP-DM ser um círculo e não uma reta: a implantação reabre o ciclo, ela não o encerra.

A consequência prática vale a regra: **a fase 3 é a mais revisitada**, porque cada volta da modelagem cai nela. Quanto tempo isso representa, o CRISP-DM não promete — e este livro não repete a porcentagem que circula por aí sem tê-la medido.

Tratar o ciclo como cascata tem um custo específico e previsível: você descobre na semana seis o que custaria uma reunião na semana um.

:::exercicio {"id":"ciclo-ciencia-de-dados-e2","tipo":"numerica","objetivo":"O3","dificuldade":"facil"}
Na fase de avaliação, a equipe descobre que rotulou como "cliente perdido" quem ficou 90 dias sem comprar — enquanto, para a área de retenção, perder um cliente é ele **não renovar o contrato**. O modelo prevê muito bem o rótulo que recebeu.

Para qual fase, de 1 a 6, o CRISP-DM manda voltar? Responda com o número.

> **volte para:** #as-setas-voltam-por-que-isto-e-um-ciclo-nao-uma-cascata
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"ciclo-ciencia-de-dados-e9","tipo":"multipla","objetivo":"O3","dificuldade":"media"}
Qual das quatro voltas do ciclo é a mais frequente em um projeto, segundo esta seção?

- [ ] Fase 2 de volta à 1, quando os dados não permitem responder à pergunta.
- [ ] Fase 4 de volta à 3, porque cada erro do modelo devolve trabalho para a preparação.
- [ ] Fase 5 de volta à 1, quando o modelo funciona e não serve.
- [ ] Fase 6 de volta a tudo, por causa do *drift*.

> **volte para:** #as-setas-voltam-por-que-isto-e-um-ciclo-nao-uma-cascata
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"ciclo-ciencia-de-dados-e10","tipo":"multipla-multi","objetivo":"O3","dificuldade":"dificil"}
Uma gerente propõe: "vamos fechar cada fase com uma aprovação formal e só então liberar a seguinte, para o projeto não ficar rodando em círculo". Quais consequências previsíveis essa proposta tem, à luz desta seção? (marque todas que valem)

- [ ] O achado da fase 2 que invalida a pergunta da fase 1 chegará depois de a fase 1 estar assinada.
- [ ] A fase 3, que é a mais revisitada, passará a exigir reabertura formal a cada erro do modelo.
- [ ] O projeto terminará mais rápido, porque não haverá retrabalho.
- [ ] A implantação será tratada como fim do projeto, e não como reabertura do ciclo.
- [ ] A qualidade do modelo melhorará, porque cada fase será verificada antes da seguinte.

> **volte para:** #as-setas-voltam-por-que-isto-e-um-ciclo-nao-uma-cascata
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

## Quem faz o quê: quatro papéis sobre o mesmo ciclo

Os cargos que o mercado usa não são especializações por técnica — são **recortes do ciclo**. Ver assim explica por que um time incompleto sempre falha na mesma fase.

| Papel | Onde vive | O que entrega |
|---|---|---|
| **Analista / dono do problema** | fases 1 e 5 | o critério de sucesso e o veredito sobre se ele foi atingido |
| **Engenheiro de dados** | fases 2 e 3 | as fontes confiáveis e o pipeline que as mantém ([cap. I.2](i-2-coleta-integracao.md)) |
| **Cientista de dados** | fases 3, 4 e 5 | atributos, modelo, e a leitura honesta do resultado |
| **Engenheiro de ML** | fases 4 e 6 | o modelo servindo em produção, monitorado ([cap. V.2](v-2-sistemas-de-ml.md), [cap. V.3](v-3-mlops.md)) |

Duas leituras saem da tabela. A primeira: **a fase 3 é onde os papéis se encontram**, com o engenheiro entregando a fonte e o cientista construindo o atributo, e por isso é onde mais se perde trabalho quando ninguém combinou quem faz o quê.

A segunda é mais séria. Num time só de gente técnica, **a fase 1 fica sem dono**. Ninguém foi contratado para descobrir qual decisão vai mudar, e o ciclo começa pela fase 2 — que é exatamente o erro da primeira seção deste capítulo. Em time pequeno, uma pessoa ocupa vários papéis, e isso funciona; o que não funciona é uma fase sem responsável declarado.

:::exercicio {"id":"ciclo-ciencia-de-dados-e3","tipo":"aberta","objetivo":"O4","pontos":3,"dificuldade":"media"}
Um time de três pessoas (um engenheiro de dados, um cientista de dados e um engenheiro de ML) vai retomar o projeto de *churn* do começo do capítulo.

Distribua as seis fases entre os três, aponte a fase que corre risco de ficar **sem dono** e diga como você resolveria isso.

> **volte para:** #quem-faz-o-que-quatro-papeis-sobre-o-mesmo-ciclo
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"ciclo-ciencia-de-dados-e11","tipo":"multipla","objetivo":"O4","dificuldade":"facil"}
De quem é a entrega "as fontes confiáveis e o pipeline que as mantém"?

- [ ] Do cientista de dados.
- [ ] Do engenheiro de dados.
- [ ] Do engenheiro de ML.
- [ ] Do analista ou dono do problema.

> **volte para:** #quem-faz-o-que-quatro-papeis-sobre-o-mesmo-ciclo
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"ciclo-ciencia-de-dados-e12","tipo":"multipla-multi","objetivo":"O4","dificuldade":"media"}
Numa retrospectiva, uma equipe relata os fatos abaixo. Quais deles são sintoma de **fase sem dono declarado**, no sentido desta seção? (marque todos que valem)

- [ ] "O alvo foi definido pelo que a tabela de compras permitia calcular."
- [ ] "O modelo está em produção há cinco meses e ninguém sabe dizer se ainda está bom."
- [ ] "O cientista de dados e o engenheiro de dados discutiram três vezes sobre a construção de um atributo."
- [ ] "Ninguém escreveu o critério de sucesso antes da primeira consulta ao banco."
- [ ] "A equipe tem três pessoas, e cada uma ocupa mais de um papel."

> **volte para:** #quem-faz-o-que-quatro-papeis-sobre-o-mesmo-ciclo
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

## Síntese — o que levar

- O CRISP-DM tem **seis fases**: entendimento do negócio, entendimento dos dados, preparação, modelagem, avaliação e implantação. Cada uma termina por **entrega**, não por prazo.
- **Modelagem é a quarta.** Começar pelos dados disponíveis faz o rótulo sair do que é fácil de calcular, e não do que é possível decidir.
- A fase 5 não é a métrica de teste: é *"isto resolve o problema da fase 1?"*. Modelo pode passar na 4 e reprovar na 5.
- **As setas voltam.** Fase 4 devolve trabalho para a 3; fase 5 devolve para a 1; a implantação reabre o ciclo por causa do *drift*.
- Os cargos são **recortes do ciclo**, não especialidades técnicas — e num time só técnico a fase 1 fica sem dono.
- Nasceu de um consórcio de quatro organizações (1996–1999), financiado pela Comissão Europeia, com montadora e seguradora na mesma mesa, para que o processo não pertencesse a nenhum fornecedor.
- **O método é o produto, não a ferramenta.** Em campo novo, o processo comum é o que torna o resultado auditável e transferível — mais do que qualquer algoritmo.

## Verificação

1. Liste as seis fases de memória e diga, em uma frase cada, **o artefato** que cada uma entrega para a seguinte.
2. Um colega diz: "não dá para conversar com o negócio antes de olhar os dados, porque não sabemos o que é possível". O que há de certo nessa objeção, e por que ela mesmo assim não justifica começar pela fase 2?
3. Você chega a um projeto em que ninguém sabe dizer qual decisão vai mudar por causa do modelo. Que perguntas você faz, e a quem, antes de escrever a primeira linha de código?
