Parte II — Análise Preditiva · Cap. II.2

Modelos Lineares

A reta que explica muito mais do que parece.

◐ essencial🕒 estado da arte 2026-08revisão 2026-09-01📖 ~81 min de leitura🎯 39 exercícios🔬 8 laboratórios🧩 37 interações⬇ md

Objetivos de aprendizagem

Um modelo linear soma atributos: cada um entra multiplicado por um número seu, e um deslocamento fecha a conta. Cada um desses números é um coeficiente. Com um atributo só, o coeficiente se chama inclinação e o deslocamento se chama intercepto.

  • O1. Derivar a regressão linear como minimização do erro quadrático.
  • O2. Calcular a inclinação e o intercepto ótimos a partir de duas somas.
  • O3. Interpretar os coeficientes de um modelo linear, e dizer o que eles não significam.
  • O4. Decidir, sob as restrições do sistema, quando o modelo linear é a escolha certa.
  • O5. Distinguir, numa afirmação histórica, o que a fonte sustenta do que é leitura deste livro.

Só de regressão linear. A regressão logística, que tem "regressão" no nome e classifica, tem capítulo próprio: II.3.

InteraçãoQuantos números o modelo estimapreveja antes de revelar

Um modelo linear é ajustado sobre três atributos.

Quantos números ele precisa estimar?

Exercíciomodelos-lineares-e42complete a lacuna

Num modelo linear, o número que multiplica um atributo chama-se ______, e aprender a lê-lo sem exagerar no que ele diz é o que este capítulo cobra.


O problema: o modelo que todo mundo aprende e quase ninguém respeita

Um banco precisa negar um crédito e explicar por quê. A lei exige a explicação, o cliente exige a explicação, e o auditor vai pedir a conta.

O modelo campeão do concurso interno, quinhentas árvores somadas, dá a melhor previsão da casa e não produz uma única frase que caiba na carta de recusa. Ele acerta mais e não serve.

InteraçãoAcerta mais e não serveexplique antes de ver

O ensemble ganhou o concurso interno por uma margem confortável de acerto.

Escreva por que isso não basta para ele ser aprovado neste banco.

Exercíciomodelos-lineares-e29escolha uma

No caso do banco, por que o modelo mais preciso é recusado?


Fundamentos: regressão linear como minimização

Comece pelo caso menor, que é onde a conta cabe inteira: um atributo só. Aí o modelo é uma reta, com a inclinação a e o intercepto b.

y^=ax+b

O chapéu marca o que o modelo produz, e sem chapéu o y é o que o mundo entregou. São n exemplos.

A dedução inteira acontece nesta reta de um atributo. A forma com muitos atributos volta mais adiante, e nada do que for deduzido aqui se perde na passagem.

InteraçãoA conta que a reta fazpreveja antes de revelar

Um modelo de uma entrada saiu do ajuste com a=2,5 e b=4. Chega um exemplo com x=6.

Quanto vale y^?

Exercíciomodelos-lineares-e15escolha uma

Ajustar um modelo linear é escolher a e b. Para saber se uma escolha é melhor que outra, o que precisa ser comparado?


Ponha a reta à mão

LaboratórioMínimos quadrados à mãomodelos-lineares-l1

Cada segmento cinza é um resíduo: a distância vertical de um ponto até a sua reta.

Minimize no olho até o número parar de cair, ligue "Ver os quadrados" para ver que ele soma áreas, e revele a ótima.

O painel chama esse número de erro quadrático médio, ou EQM: a soma das áreas cinza, dividida pelo número de pontos.

Exercíciomodelos-lineares-e43responda com um número

Uma reta deixa os resíduos −1, +2, −2 e +3. Qual é a soma das áreas dos quadrados?


O critério: minimizar o erro quadrático médio

Você já minimizou este número com a mão. Escrito com símbolos, ele é a função que o ajuste minimiza, e escolher a reta que a torna menor é o método dos mínimos quadrados:

L(a,b)=1n∑i=1n(yi−y^i)2

Três convenções, a mesma reta. Muito texto escreve 12n, porque o meio cancela o 2 que desce ao derivar; outros minimizam a soma. Constante positiva não move o mínimo, e a reta é a mesma nas três.

InteraçãoO EQM de três pontoscomplete os passos que faltam

Uma reta erra +2, −1 e +3 nos três pontos do conjunto. Complete a conta:

  1. soma dos quadrados
  2. divisão pelo número de pontos
Exercíciomodelos-lineares-e8escolha uma

Três textos escrevem a perda como 1n∑(y−y^)2, 12n∑(y−y^)2 e ∑(y−y^)2. O que muda entre eles?


Por que ao quadrado, e não em valor absoluto

Três razões, em ordem de honestidade:

  1. É diferenciável em todo ponto, o que faz o otimizador funcionar sem casos especiais. O erro absoluto, que soma o módulo do resíduo em vez do quadrado, tem um bico em zero.
  2. Tem solução fechada. Derivando e igualando a zero, chega-se às equações normais, um sistema linear que se resolve de uma vez.
  3. Pune o erro grande desproporcionalmente, o que às vezes é o que você quer e às vezes não é. Havendo outliers, o erro quadrático os persegue.
InteraçãoO peso do ponto distantepreveja antes de revelar

Um ponto erra por 1; o outlier erra por 10. No critério absoluto o segundo pesa 10 vezes mais.

E no quadrático, quantas vezes?

Exercíciomodelos-lineares-e1escolha uma

Por que a regressão linear minimiza o erro ao quadrado em vez do erro absoluto?


Escolher entre duas retas, sem derivada nenhuma

Três pontos: (1,3), (2,5) e (3,4). Duas retas candidatas, e o critério decidindo entre elas.

A primeira é y^=x+2. Ela prevê 3, 4 e 5; os resíduos são 0, +1 e −1; os quadrados são 0, 1 e 1. O EQM é 2/3≈0,67.

Nenhuma derivada apareceu aqui. O critério é uma conta de aritmética que qualquer pessoa refaz, e é por isso que ele arbitra.

InteraçãoA segunda candidatacomplete os passos que faltam

A segunda reta é y^=0,5x+3, e ela prevê 3,5, 4 e 4,5 nos mesmos três pontos. Complete:

  1. resíduos
  2. soma dos quadrados
  3. EQM
Exercíciomodelos-lineares-e44responda com um número

Uma terceira candidata entra na disputa, nos mesmos pontos (1,3), (2,5) e (3,4): a reta y^=2x. Calcule o EQM dela, com duas casas decimais.


A dedução, em cinco passos

Por que existe uma reta ótima única, e como o computador a encontra sem tentar todas?

A reta é a mesma y^=ax+b do cartão dos fundamentos, e o critério é o mesmo EQM. Escrito com a reta dentro:

L(a,b)=1n∑i=1n(yi−axi−b)2

Passo 1 — por que há um mínimo, e um só

L é uma soma de quadrados: a tigela que você percorreu no laboratório, convexa em (a,b). Tigela tem um fundo, e só um.

InteraçãoDois começos, um destinopreveja antes de revelar

Duas pessoas arrastam a reta do laboratório a partir de posições bem diferentes, até o EQM parar de cair.

Onde elas param?

Exercíciomodelos-lineares-e17escolha uma

Por que a convexidade de L torna o ajuste confiável?


Passo 2 — no fundo, as derivadas se anulam

Derivando em relação a b:

∂L∂b=−2n∑i=1n(yi−axi−b)=0 ⟹∑i=1nri=0

onde ri=yi−axi−b é o resíduo. A soma dos resíduos é zero. Dividindo por n: y¯=ax¯+b, ou seja, b=y¯−ax¯.

InteraçãoDe zero a centro de massaexplique antes de ver

A condição de mínimo em b diz apenas que a soma dos resíduos é zero.

Como se sai daí para "a reta passa por (x¯,y¯) "?

Exercíciomodelos-lineares-e10responda com um número

Uma reta de mínimos quadrados tem inclinação a=2,5. As médias dos dados são x¯=4 e y¯=18.

Qual é o intercepto b?


Passo 3 — a segunda condição

Derivando em relação a a:

∂L∂a=−2n∑i=1nxi(yi−axi−b)=0 ⟹∑i=1nxiri=0

Os resíduos são ortogonais ao atributo. O que sobrou de erro não tem mais nada de linear em x : se tivesse, a reta ainda poderia melhorar.

InteraçãoDe onde sai o xᵢexplique antes de ver

As duas condições do mínimo, uma sob a outra, trazem o resíduo multiplicado por coisas diferentes:

∂L∂b=−2n∑iri ∂L∂a=−2n∑ixiri

Por que o xi aparece ao derivar em relação a a, e não em relação a b?

Exercíciomodelos-lineares-e18complete a lacuna

Numa reta já ajustada por mínimos quadrados, some os produtos de cada atributo pelo seu resíduo, ∑ixiri. O resultado vale sempre ______.


Passo 4 — resolver o sistema

Substituindo b=y¯−ax¯ na segunda condição e reorganizando em torno das médias:

a=∑i=1n(xi−x¯)(yi−y¯)∑i=1n(xi−x¯)2=SxySxx

Duas contas, uma soma de produtos e uma soma de quadrados, e a reta está pronta. Sem iteração, sem taxa de aprendizado, sem critério de parada.

InteraçãoProduto em cima, quadrado embaixoexplique antes de ver

O numerador soma produtos de dois desvios; o denominador soma quadrados de um só.

Por que o denominador tem quadrado, se o numerador tem produto?

Exercíciomodelos-lineares-e19responda com um número

Um conjunto tem três pontos cujos desvios em x são −2, 0 e +2, e cujos desvios em y são −3, 0 e +3.

Calcule a inclinação a da reta de mínimos quadrados. Responda com duas casas decimais.


Uma vez com número

Três pontos: (1, 3), (2, 5) e (3, 4). As médias são x¯=2 e y¯=4. Os desvios em x são −1, 0, +1; em y, −1, +1, 0.

Sxy=(−1)(−1)+(0)(1)+(1)(0)=1 Sxx=1+0+1=2

Logo a=1/2=0,5, e b=4−0,5×2=3. A reta é y^=0,5x+3, e passa por (2,4).

InteraçãoO mesmo caminho, outros três pontoscomplete os passos que faltam

Agora os pontos são (0, 1), (1, 2) e (2, 6): x¯=1, y¯=3, desvios em x de −1, 0, +1 e em y de −2, −1, +3.

  1. S_xy
  2. S_xx
  3. a
  4. b
Exercíciomodelos-lineares-e7responda com um número

Quatro pontos: (1, 2), (2, 3), (3, 5) e (4, 6). Calcule a inclinação a da reta de mínimos quadrados, com duas casas decimais.


Passo 5 — o que a fórmula avisa

O denominador é a variação de x. Se Sxx=0, todos os x são iguais, e não existe reta: nenhuma inclinação é melhor que outra. Não é falha numérica, é o dado não conter a informação.

InteraçãoQuarenta dias pelo mesmo preçopreveja antes de revelar

Uma barraca vendeu limonada por quarenta dias e cobrou 0,30 por copo em todos eles. Você quer ajustar vendas contra preco.

Quanto vale Sxx do preço?

Exercíciomodelos-lineares-e11escolha uma

Ao ajustar uma reta, o denominador Sxx dá zero. O que isso significa?


O andaime sai

No cartão do exemplo trabalhado, a conta veio pronta. No desvanecido, uma parte veio pronta. Aqui não vem nada: quatro pontos, quatro linhas em branco, e a mesma receita de sempre.

Se a sua conta bater com a resposta, você não decorou uma fórmula. Você executou um procedimento, que é o que a próxima parte do capítulo vai começar a esticar.

InteraçãoQuatro pontos, nenhuma linha prontacomplete os passos que faltam

Os pontos são (2,4), (4,9), (6,11) e (8,16). Faça as quatro linhas:

  1. médias
  2. S_xy
  3. S_xx
  4. a e b
Exercíciomodelos-lineares-e45responda com um número

Uma equipe decide ajustar uma reta que passa pela origem: y^=ax, sem intercepto nenhum. A perda vira L(a)=1n∑i(yi−axi)2, com um parâmetro só.

Refaça a dedução para esse modelo, derivando e igualando a zero, e calcule a para os pontos (1,2), (2,3) e (3,7). Responda com duas casas decimais.


De um atributo para vários

A dedução inteira foi feita com um atributo, porque assim a conta cabe na página. Um modelo de trabalho soma muitos:

y^=w1x1+w2x2+⋯+wdxd+b

São n exemplos e d atributos, e wj é o coeficiente do atributo j. Com um atributo só, w1 é a inclinação a que você vinha calculando.

O que sobrevive à passagem é o raciocínio inteiro: o critério continua sendo o EQM, a rota continua sendo derivar e igualar a zero, e a superfície continua sendo uma tigela. O que muda é a contagem: em vez de duas condições de mínimo há d+1, uma por parâmetro, e resolvê-las deixa de caber numa linha.

InteraçãoCinquenta atributos, quantas condiçõespreveja antes de revelar

Um modelo linear com intercepto é ajustado sobre 50 atributos.

Quantas condições de mínimo o sistema tem?

Exercíciomodelos-lineares-e46escolha uma

Passando de um atributo para d, o que deixa de valer da dedução que você acabou de fazer?


Quando duas colunas dizem quase a mesma coisa

Com muitos atributos aparece um problema que não existia com um: duas colunas podem carregar quase a mesma informação. Uma barraca que distribui mais panfletos nos dias quentes tem panfletos e temperatura subindo juntas, e nenhuma das duas varia sozinha.

Isso se chama colinearidade. Ela não estraga a previsão: se muitas combinações de pesos dão quase o mesmo erro, o erro de validação não muda. O que ela deforma é a superfície que o otimizador percorre.

InteraçãoA forma que dois atributos colineares desenhampreveja antes de revelar

Muitas combinações de pesos dão quase o mesmo erro.

Que forma isso dá à superfície de erro?

Exercíciomodelos-lineares-e47escolha uma

No passo 5, Sxx=0 deixava a reta sem existir. Sob colinearidade, o que acontece com a conta?


Padronizar muda a forma, não o modelo

Padronizar é pôr cada atributo na mesma escala: de cada valor subtrai-se a média da coluna e divide-se pelo desvio. Não é higiene de planilha: é o que transforma o vale estreito do cartão anterior num vale redondo.

A álgebra não anda por superfície nenhuma. Ela iguala as derivadas a zero e resolve o sistema, e o vale estreito lhe dá o mesmo trabalho que o redondo. O capítulo II.4 retoma esta superfície pelo lado da taxa de aprendizado.

InteraçãoO que padronizar muda no resultadopreveja antes de revelar

O mesmo conjunto é ajustado duas vezes: como veio, e padronizado.

O que muda entre os dois ajustes?

Exercíciomodelos-lineares-e20escolha uma

Dois atributos quase colineares deixam a superfície num vale estreito, e padronizar a deixa redonda. Por que a solução fechada devolve a resposta exata nos dois casos?


O gradiente contra a álgebra

Agora as duas rotas no mesmo dado, com dois atributos quase colineares. O placar mede o excesso sobre o ótimo fechado.

LaboratórioO gradiente atrás de uma resposta que já existemodelos-lineares-l2

Trezentos pontos, 4 000 passos. Rode como os atributos vieram, depois padronizados.

InteraçãoQuantos passospreveja antes de revelar

Arrisque o número antes de conferir.

Padronizados os atributos, em que passo o excesso cai abaixo de 1%?

Exercíciomodelos-lineares-e26escolha uma

O que serve de referência para o zero do placar?


A solução fechada existe. Por que, então, gradiente?

Você acabou de ver o gradiente gastar 1 460 passos para alcançar um lugar que a álgebra já ocupava desde o primeiro instante. A pergunta é legítima, e é a mesma que um aluno faz em voz alta: então por que aprender o gradiente?

A solução fechada está implementada na etapa 05, em 25 linhas de eliminação de Gauss. Vale conferir: gradiente e solução fechada chegam ao mesmo lugar, com diferença menor que 0,05 em cada coeficiente. Isso desmistifica o gradiente, que passa a ser um jeito de resolver, não o jeito.

InteraçãoDuas rotas, o mesmo lugarexplique antes de ver

No experimento do livro, gradiente e solução fechada param a menos de 0,05 um do outro em cada coeficiente.

O que essa coincidência autoriza você a concluir, e o que ela não autoriza?

Exercíciomodelos-lineares-e9escolha uma

Se a solução fechada das equações normais é exata e existe, por que o livro ensina o gradiente?


Interpretar coeficientes — e o que eles não dizem

O modelo linear é interpretável, e é por isso que ele sobrevive em crédito, seguro e saúde. Mas "interpretável" não significa "fácil de interpretar corretamente".

O que o coeficiente diz

Aumentar xj em uma unidade muda y^ em wj unidades, mantendo os demais atributos constantes. É a leitura mais direta que um modelo oferece.

Na regressão logística a leitura é outra: o coeficiente multiplica a razão de chances, não a saída. Confundir as duas é o erro de interpretação mais comum deste livro.

InteraçãoTrinta e cinco por metro quadradopreveja antes de revelar

Um modelo de aluguel saiu assim, com a área em metros quadrados: y^=1200+35x.

Quanto muda a previsão entre dois imóveis que diferem em 10 m²?

Exercíciomodelos-lineares-e21responda com um número

Um modelo prevê o limite de crédito em reais, com a renda em reais e os dependentes em pessoas:

limite = 500 + 0,12 · renda − 800 · dependentes

Comparando dois clientes, um com 2 000 reais a mais de renda e um dependente a mais que o outro, quanto muda o limite previsto?


O caso da limonada

O conjunto em ml-zero/dados/limonada/ traz 365 dias de uma barraca.

InteraçãoO sinal que você esperapreveja antes de revelar

Preço cobrado e copos vendidos andam juntos nestes 365 dias.

Com que sinal?

atributo correlação com vendas
temperatura +0,990
precipitacao −0,909
panfletos +0,805
preco +0,513

Calor vende, chuva atrapalha, panfleto ajuda. E preço mais alto vende mais.

LaboratórioPrimeira voltamodelos-lineares-l3

A primeira das cinco voltas do painel.

Exercíciomodelos-lineares-e22responda com um número

Clique em Ajustar e responda o coeficiente de preco, com uma casa.


O preço é um termômetro disfarçado

preço dias temperatura média* vendas médias meses em que aparece
0,30 303 57,0 23,7 jan–jun, set–dez
0,50 62 78,8 33,1 só julho e agosto

* A unidade não está no arquivo. A faixa (15,1 a 102,9) é típica de Fahrenheit.

LaboratórioSegunda voltamodelos-lineares-l4

Marque temperatura e ajuste de novo.

InteraçãoO que o preço está marcandoexplique antes de ver

O preço de 0,50 aparece em 62 dias, todos em julho e agosto.

Escreva o que esse fato faz com a correlação de +0,513.

Exercíciomodelos-lineares-e23responda com um número

Com temperatura marcada, responda o coeficiente de preco, com duas casas.


O passo que deveria salvar, e não salva

A resposta de manual é controlar pelas outras variáveis: marque as duas que faltam.

LaboratórioTerceira voltamodelos-lineares-l5

Marque as duas caixas e ajuste. Uma linha nova aparece embaixo.

Ela é o coeficiente de determinação, o R2: a fração da variação de vendas que o modelo reproduz, de 0 (prever sempre a média) a 1 (acertar cada ponto). Ele sai altíssimo, e é por ser altíssimo que está aqui.

InteraçãoQuem explica os 9,4 coposcomplete os passos que faltam

Do preço 0,30 para o 0,50 a venda sobe 9,4 copos, e a temperatura sobe de 57,0 para 78,8. Complete as duas parcelas:

  1. temperatura: 0,3692 × (78,8 − 57,0)
  2. preço: 2,4143 × (0,50 − 0,30)
Exercíciomodelos-lineares-e24responda com um número

Com as quatro colunas no ajuste, responda o R2, com três casas.


O coeficiente do preço continua positivo: a temperatura média não captura ser julho, e o que sobrou de julho mora dentro de preco.

Um confundidor é a variável que mexe nas outras duas e cria associação sem causa. Aqui ele é "ser julho", e ninguém o mediu: controlar por uma variável só remove o confundimento que aquela variável mede.

LaboratórioQuarta voltamodelos-lineares-l6

alta_temporada vale 1 nos 62 dias de julho e agosto, e 0 nos outros 303.

InteraçãoO que a temperatura não carregouexplique antes de ver

A temperatura entrou no modelo e o coeficiente do preço continuou positivo.

O que "ser julho" tem que "78,8 graus" não tem?

Exercíciomodelos-lineares-e5responda com um número

Marque alta_temporada e ajuste: o painel recusa. Desmarque preco, ajuste de novo, e responda o coeficiente de alta_temporada, com três casas.


O panfleto, de brinde

Vem outro de brinde: temperatura e panfletos correlacionam +0,798, porque em dia quente distribuíam-se mais panfletos. O coeficiente do panfleto sai em 0,0188, e lido como efeito da panfletagem é falso.

Colinearidade não estraga a previsão. Estraga a leitura, porque o erro de validação não muda.

LaboratórioQuinta voltamodelos-lineares-l7

O corte escolhe quantos dias entram. Mexa nele e ajuste de novo.

InteraçãoPanfleto em dia frioexplique antes de ver

Suponha que a barraca passasse a distribuir a mesma quantidade de panfletos em dia frio e em dia quente, e que o modelo fosse reajustado.

Escreva o que aconteceria com o coeficiente de panfletos, e por quê.

Exercíciomodelos-lineares-e4responda com um número

Ponha o corte em 200 e ajuste. Responda o coeficiente de panfletos, com quatro casas.


O conserto óbvio

O conserto de manual seria isolar um período em que o preço varie sem a estação variar junto: recortar um mês, onde o calor é parecido dia após dia.

LaboratórioSexta voltamodelos-lineares-l8

Escolha um mês e ajuste. Depois tente outro, e outro.

O painel recusa nos doze, e o aviso é o do passo 5: em cada mês o preço tem um valor só, então Sxx dele é zero. O confundimento aqui é perfeito, e preço e estação são a mesma variável com dois nomes.

InteraçãoO dado que teria respondidoexplique antes de ver

A pergunta da dona da barraca não tem resposta nestes 365 dias.

Descreva a coleta que teria respondido a ela.

Exercíciomodelos-lineares-e27responda com um número

Recorte julho, desmarque preco e ajuste. Responda o R2, com três casas.


Mão na massa

A etapa 05–06 do ml-zero implementa, em biblioteca padrão, a RegressaoLinear com os dois caminhos (solução fechada por eliminação de Gauss e gradiente), e o Padronizador, que aprende no treino e aplica ao teste.

O notebook refaz a análise dos últimos cartões célula a célula, e a última delas traz um # TODO. É ali que este cartão cobra alguma coisa: você altera um número, roda, e traz o resultado de volta para o exercício.

Notebook pronto para executar — regressao_limonada.ipynb · abrir no Colab

InteraçãoOnde o padronizador aprendepreveja antes de revelar

O Padronizador guarda a média e o desvio de cada atributo para poder reescalar os dados.

De onde ele tira esses números?

Exercíciomodelos-lineares-e48responda com um número

Abra o notebook e vá até a célula marcada com # TODO. Troque corte = 300 por corte = 250: o modelo passa a treinar nos 250 primeiros dias e a ser avaliado nos 115 últimos. Rode e responda o R² no teste, com três casas decimais.


As quatro coisas que ele não diz

As quatro, como lista de conferência:

  1. Não diz causalidade. "Mantendo tudo mais constante" é operação sobre a equação, não intervenção no mundo.
  2. Não é comparável sem padronização. Um coeficiente de 0,003 para renda e 2,5 para filhos não diz que filhos importam mais.
  3. Não é confiável sob colinearidade. Atributos que andam juntos trocam peso entre si.
  4. Não vale fora da faixa observada. Extrapolar é usar a reta onde ela nunca viu dado: a 120 graus ela continua traçando, e o absurdo sai com aparência de rigor.
InteraçãoO que a métrica enxergaexplique antes de ver

Um painel com erro de treino, erro de validação e R², todo verde.

Quais dos quatro itens acima esse painel detectaria?

Exercíciomodelos-lineares-e12escolha uma

Num modelo de crédito, renda_declarada e renda_comprovada são quase idênticas. Com 200 linhas novas no treino, o coeficiente de um foi de +0,8 para −0,4, e o do outro fez o inverso. O erro de teste não mudou. Qual limitação isto ilustra?


Quando o linear é a escolha certa

Não como consolo, e sim como decisão de engenharia.

InteraçãoEscolher o pior, de propósitoexplique antes de ver

Uma pergunta que só tem resposta boa se você pensar no sistema inteiro, e não no placar.

Descreva uma situação em que você escolheria o linear sabendo que ele vai prever pior.

Exercíciomodelos-lineares-e41complete a lacuna

Complete: as cinco linhas da tabela seguinte são ______ do sistema, e é por isso que nenhuma delas aparece na métrica de teste.


Situação Por quê
Poucos dados por atributo menos parâmetros, menos variância: com 200 linhas e 50 colunas, o ensemble decora
Necessidade de auditoria um número por atributo, defensável. Exigência regulatória em crédito e seguro
Probabilidade que vira dinheiro sai razoavelmente calibrado; ensembles frequentemente não (cap. II.1)
Linha de base obrigatória é a régua contra a qual o modelo complexo se justifica
Latência apertada uma multiplicação de vetores, muito mais rápida que uma floresta
InteraçãoA linha que vale sempreexplique antes de ver

Quatro linhas da tabela só entram quando a restrição correspondente existe. Uma vale sempre.

Escreva qual é, e o que ela responde que as outras quatro não respondem.

Exercíciomodelos-lineares-e25escolha uma

Um time tem 15 000 linhas, 8 atributos, nenhuma exigência de auditoria e nenhum limite de latência. O que a tabela diz sobre a escolha?


Duas linhas da tabela, por dentro

Duas das cinco escondem um mecanismo, e é o mecanismo que decide.

Poucos dados por atributo. Com 50 colunas o linear estima 51 números. Um ensemble de árvores estima uma estrutura muito maior a partir das mesmas linhas, e sobra amostra para cada corte decorar ruído.

Probabilidade que vira dinheiro. O linear sai razoavelmente calibrado, e ensembles frequentemente precisam de correção posterior (capítulo II.1). Ordenar bem e acertar o valor são exigências diferentes, e só a segunda sobrevive a uma multiplicação.

InteraçãoDuzentas linhas, cinquenta colunasexplique antes de ver

Um conjunto tem 200 linhas e 50 colunas, e você compara um linear com um ensemble.

Escreva quem tende a ir melhor no teste, e faça a contagem que sustenta a sua resposta.

Exercíciomodelos-lineares-e30escolha uma

Uma equipe multiplica a probabilidade prevista pelo valor da apólice para provisionar. Por que a calibração pesa mais que a ordenação?


O caso da seguradora

Quatro restrições numa proposta só, e nenhuma delas é sobre acertar mais. Uma seguradora precisa de um modelo treinado em 300 apólices com 40 atributos, com resposta em menos de 10 ms, justificativa por escrito ao regulador em cada recusa, e a probabilidade multiplicada pelo valor da apólice para calcular a provisão.

A comparação que a equipe pretende fazer é por AUC (area under the curve, área sob a curva), a métrica que o capítulo II.1 apresenta: a probabilidade de um caso positivo sorteado ao acaso receber escore maior que um negativo sorteado ao acaso. Ela mede ordenação, e só ordenação.

InteraçãoO que a AUC não vêexplique antes de ver

Sobre a proposta acima, com as quatro restrições postas lado a lado.

Quais dessas quatro restrições apareceriam numa comparação feita só por AUC?

Exercíciomodelos-lineares-e14escolha todas que valem

Ainda no caso da seguradora acima: quais dessas restrições, sozinhas, já apontam para o modelo linear? (marque todas que valem)


Treine sempre um linear primeiro

A linha de base tem um corolário que vale sozinho: sempre treine um linear primeiro. Ele custa minutos e responde à pergunta anterior a todas as outras, que é "quanto do sinal é simplesmente linear?".

E o contraexemplo honesto, para o corolário não virar fé: no capítulo II.5 o linear faz 0,4963 de AUC contra 0,9392 do boosting, num dado de fronteira irregular.

InteraçãoQuando o ganho é pequenoexplique antes de ver

Você treinou o linear, treinou o complexo depois, e no mesmo teste o ganho do segundo foi pequeno.

Escreva o que esse resultado revelou, e a decisão de engenharia que ele autoriza.

Exercíciomodelos-lineares-e6responda com suas palavras

Agora use tudo. A dona da barraca de limonada quer decidir o preço do próximo verão e pede ajuda. Você tem os 365 dias do conjunto e um modelo linear com R2 de 0,982, que é exatamente o tipo de linha de base que este cartão manda treinar primeiro.

Escreva a resposta que você daria a ela, em até seis linhas, sem jargão. Diga o que o modelo serve para responder, o que ele não serve, e o que você precisaria para responder a pergunta que ela fez.


De onde isto veio

O aperto. Virada do século XVIII para o XIX, astronomia. Um cometa é observado em noites diferentes, e as observações não concordam. A órbita é uma só, e não há critério defensável para escolher a curva.

O que se fazia antes. Escolhia-se a olho. Dois astrônomos competentes chegavam a órbitas diferentes.

A virada. Trocar "a melhor curva" por uma regra explícita: a que torna mínima a soma dos quadrados dos desvios. Ela não é mais verdadeira que as outras, é pública: devolve a mesma resposta para qualquer pessoa.

O nome. Moindres carrés, mínimos quadrados, é de Legendre, e é a definição do critério.

InteraçãoDois astrônomos, os mesmos dadosexplique antes de ver

Dois astrônomos recebem as mesmas observações e escolhem a olho.

Escreva o que eles obtêm, e diga se a média das duas escolhas resolveria.

Exercíciomodelos-lineares-e31complete a lacuna

Escreva o que faltava naquela astronomia: não era observação nem instrumento melhor, era uma ______ explícita do que conta como a melhor curva.


Perda é critério de arbitragem

A ideia reaproveitável. Uma função de perda é um critério de arbitragem, não uma descoberta sobre o mundo: existe para tornar a escolha reproduzível e discutível.

Legendre publicou primeiro, em 1805. Gauss publicou em 1809, afirmando usar o método desde 1795. Stigler (1981) argumenta "though not conclusively" que Gauss o possuía antes, sem conseguir comunicá-lo.

No capítulo III.1 o crédito pelo backpropagation fica com quem reinventou por último. Os dois casos dizem: crédito não segue descoberta, segue comunicação.

InteraçãoTrocar a perda é trocar o quêexplique antes de ver

Uma equipe passa a minimizar o erro absoluto, nos mesmos dados.

Escreva o que essa equipe está trocando, e o que continua exatamente igual.

Exercíciomodelos-lineares-e35escolha uma

O que o resumo de Stigler, como o capítulo o cita, permite afirmar?


Procedência das afirmações desta seção:

Selo Afirmação
✓ᵐ Legendre (1805) e Gauss (1809): obra, ano e conteúdo geral. Nenhuma das duas lida no original
✓ᵃ A tese que Stigler declara e o trecho citado entre aspas, do resumo de "Gauss and the Invention of Least Squares", Annals of Statistics 9(3):465–474, 1981, 10.1214/aos/1176345451 — resumo lido no original; o corpo, não
⏳ As notas de Olbers (1816) e Bessel (1832), e o ataque público de Legendre em 1820. O resumo de Stigler fala em "new evidence, both documentary and statistical", sem nomear quais
📖 A ideia reaproveitável ("perda é critério de arbitragem") e a ligação com o capítulo III.1
InteraçãoO selo da ideia reaproveitávelexplique antes de ver

"Perda é critério de arbitragem" é a frase que este capítulo mais quer que você leve embora.

Escreva que selo ela leva na tabela, e o que o selo escolhido nega sobre ela.

Exercíciomodelos-lineares-e37complete a lacuna

"Perda é critério de arbitragem" não é afirmação de fonte histórica: é ______ deste livro, e o selo 📖 existe para dizer isso.


Síntese — o que levar

  • Regressão linear minimiza erro quadrático por diferenciabilidade e solução fechada, não por ser intrinsecamente mais correto.
  • A dedução dá duas condições: a soma dos resíduos é zero, e os resíduos são ortogonais ao atributo.
  • a=Sxy/Sxx, e o denominador avisa: atributo que não varia não tem coeficiente.
  • Gradiente e solução fechada chegam ao mesmo lugar. O gradiente é a ferramenta geral; a fechada é o caso de sorte.
  • Coeficiente não é causa, não é comparável sem padronização, não é estável sob colinearidade, e não vale fora da faixa observada.
  • Treine sempre um linear primeiro, porque ele responde em minutos quanto do sinal é simplesmente linear.
  • Uma perda é um critério de arbitragem: quem escolhe a perda escolhe o que conta como erro.
InteraçãoA frase que você diria ao colegaexplique antes de ver

Um colega quer aprovar um ensemble para um sistema de crédito sem treinar o linear antes.

Escreva a frase que você diria a ele, usando uma das linhas acima.

Exercíciomodelos-lineares-e39complete a lacuna

Complete a síntese do capítulo: uma função de perda é um ______ de arbitragem, e não uma descoberta sobre o mundo.


Verificação

  1. Mostre, sem consultar o texto, por que a reta de mínimos quadrados passa necessariamente pelo ponto (x¯,y¯).
  2. Você tem 180 linhas e 60 atributos. Que família de modelo você tenta primeiro, e por quê?
  3. Dois atributos do seu modelo são quase idênticos. O erro de validação está ótimo. O que pode estar errado mesmo assim?
  4. No laboratório, o que aconteceria com a reta ótima se todos os pontos tivessem o mesmo x? Responda pela fórmula, não pelo desenho.
InteraçãoA primeira, de cabeçaexplique antes de ver

Responda a questão 1 antes de revelar, com as suas palavras.

Por que a reta ótima passa por (x¯,y¯)?

Exercíciomodelos-lineares-e40responda com um número

Questão 3, na célula 8.1 do notebook. Troque arredondar para True e rode: entra uma cópia da temperatura, arredondada ao grau. Responda o coeficiente de temperatura, com quatro casas.

Exercíciomodelos-lineares-e50responda com um número

Questão 4, na célula 8.2 do mesmo notebook. Ponha mes = 7 e rode: sai o Sxx de cada coluna em julho. Responda o da temperatura, arredondado à unidade.