Prova da Parte II — Análise Preditiva
Estado da arte capturado em 2026-08 · histórico
Isto não vale nota, e o livro diz isso por escrito. A identificação é autodeclarada, o livro fica aberto e o enunciado está publicado no Markdown do repositório. O que esta prova produz é evidência de prática, não de aprendizado. A recomendação do livro a quem dá aula é pontuar por ter feito, nunca por ter acertado: pontuar esforço remove o incentivo de colar, pontuar acerto o cria.
O que esta prova é
Doze itens sobre os oito capítulos da Parte II, de II.1 a II.8. Cada item cruza dois capítulos ou mais, e é essa a diferença entre uma prova e mais uma lista.
Nenhum item traz o "volte para": a prova mede o que você recupera sem rota de volta. Todo cenário é inédito, para que reconhecer o exemplo não substitua entender o conceito. E todos os itens são corrigidos na hora, sem consultar modelo de linguagem.
prova-parte-ii-q1escolha umaUma transportadora usa um modelo para decidir quais cargas passam por inspeção extra. Inspecionar custa R$ 80. Uma carga irregular que passa sem inspeção custa R$ 3 200 em multa. Não inspecionar carga regular não custa nada.
Qual é a leitura correta da relação entre métrica e limiar aqui?
prova-parte-ii-q2escolha umaUm modelo linear tem dois atributos quase perfeitamente correlacionados. Sem regularização, os coeficientes trocam de sinal entre reamostragens. Com L1, um dos dois é zerado, e qual deles muda de execução para execução. Com L2, ambos ficam pequenos e estáveis.
Qual leitura é correta?
prova-parte-ii-q3escolha todas que valemUma equipe treina um gradient boosting e uma floresta aleatória no mesmo problema. Quais decisões estão corretas? (marque todas que valem)
prova-parte-ii-q4responda com um númeroUm modelo de regressão logística prevê probabilidade 0,25 para um cliente. Qual é a chance (odds) correspondente? Responda com duas casas decimais.
prova-parte-ii-q5escolha umaUma equipe monta o conjunto de treino a partir do cubo de vendas, com uma linha por cliente e mês, e atributos de janela vindos das medidas agregadas. Depois divide o conjunto cronologicamente, com cuidado, e valida com origem móvel.
Ainda assim o desempenho em produção é muito pior que na validação. Qual é a explicação mais provável?
prova-parte-ii-q6escolha umaDois modelos são comparados no mesmo teste. A diferença de F1 é de 0,004, e o bootstrap pareado devolve um intervalo de 95% de [−0,009; +0,017] para a diferença. Um deles custa três vezes mais para servir. O que fazer?
prova-parte-ii-q7escolha todas que valemUm hospital precisa de um modelo com 1 200 registros, 60 atributos tabulares, justificativa por escrito em cada recusa de exame, e resposta em menos de 20 ms. Quais afirmações estão corretas? (marque todas que valem)
prova-parte-ii-q8escolha umaUm painel executivo mostra "taxa de conversão média das lojas: 4,2%", calculada como a média simples das taxas de cada loja. Uma loja nova, com 12 visitas e 3 conversões, entra na conta com 25%.
Qual é o problema?
prova-parte-ii-q9escolha umaUma equipe troca a perda de uma classificação de entropia cruzada para erro quadrático sobre a saída da sigmoide. O treino roda sem erro, a perda desce, e o resultado final varia de execução para execução com a mesma configuração.
Qual é a explicação?
prova-parte-ii-q10responda com um númeroUma série mensal tem sazonalidade anual forte. Um relatório compara o modelo novo contra a previsão ingênua simples e celebra 40% de redução de erro.
Quantas linhas de base diferentes deveriam ter sido reportadas, no mínimo, para a comparação ser honesta?
prova-parte-ii-q11escolha umaUm relatório traz: problema, dados, protocolo, resultado com intervalo de confiança e recomendação de aumentar o preço com base num coeficiente positivo. O protocolo está impecável e o R² é 0,982.
Qual parte do relatório mínimo está faltando, e o que ela teria impedido?
prova-parte-ii-q12escolha todas que valemUm modelo de priorização de atendimento tem AUC de 0,88 ± 0,01 entre as dobras, bate a linha de base com folga e o ganho financeiro estimado paga o custo. Ao segmentar, o desempenho cai para 0,61 no grupo de pacientes que chegam pelo pronto-socorro, que é 18% do volume.
Quais conclusões se sustentam? (marque todas que valem)