Objetivos de aprendizagem
Um modelo linear soma atributos: cada um entra multiplicado por um número seu, e um deslocamento fecha a conta. Cada um desses números é um coeficiente. Com um atributo só, o coeficiente se chama inclinação e o deslocamento se chama intercepto.
- O1. Derivar a regressão linear como minimização do erro quadrático.
- O2. Calcular a inclinação e o intercepto ótimos a partir de duas somas.
- O3. Interpretar os coeficientes de um modelo linear, e dizer o que eles não significam.
- O4. Decidir, sob as restrições do sistema, quando o modelo linear é a escolha certa.
- O5. Distinguir, numa afirmação histórica, o que a fonte sustenta do que é leitura deste livro.
Só de regressão linear. A regressão logística, que tem "regressão" no nome e classifica, tem capítulo próprio: II.3.
Um modelo linear é ajustado sobre três atributos.
Quantos números ele precisa estimar?
Quatro. Um coeficiente por atributo, e mais o intercepto, que não pertence a atributo nenhum.
Quem respondeu três esqueceu o deslocamento, e ele é estimado como os outros: ninguém o entrega pronto. Guarde a contagem, porque ela volta como argumento de escolha de modelo no fim do capítulo.
modelos-lineares-e42complete a lacunaNum modelo linear, o número que multiplica um atributo chama-se ______, e aprender a lê-lo sem exagerar no que ele diz é o que este capítulo cobra.
O problema: o modelo que todo mundo aprende e quase ninguém respeita
Um banco precisa negar um crédito e explicar por quê. A lei exige a explicação, o cliente exige a explicação, e o auditor vai pedir a conta.
O modelo campeão do concurso interno, quinhentas árvores somadas, dá a melhor previsão da casa e não produz uma única frase que caiba na carta de recusa. Ele acerta mais e não serve.
O ensemble ganhou o concurso interno por uma margem confortável de acerto.
Escreva por que isso não basta para ele ser aprovado neste banco.
Porque o requisito não é acerto, é explicação por escrito, e ele não está no placar. Um modelo que erra um pouco mais e escreve a frase atende ao cliente, ao regulador e ao auditor; o campeão não atende a nenhum dos três.
O erro de raciocínio que isto desfaz é tratar a métrica como se ela fosse o problema inteiro. A métrica é uma das restrições, e a mais fácil de medir, e por isso ela ocupa a conversa toda.
A ideia reaproveitável vale fora de crédito: antes de comparar modelos, escreva a lista de requisitos que a comparação não enxerga.
modelos-lineares-e29escolha umaNo caso do banco, por que o modelo mais preciso é recusado?
Fundamentos: regressão linear como minimização
Comece pelo caso menor, que é onde a conta cabe inteira: um atributo só. Aí o modelo é uma reta, com a inclinação
O chapéu marca o que o modelo produz, e sem chapéu o
A dedução inteira acontece nesta reta de um atributo. A forma com muitos atributos volta mais adiante, e nada do que for deduzido aqui se perde na passagem.
Um modelo de uma entrada saiu do ajuste com
Quanto vale
19, de
Repare no que a forma permite dizer em voz alta: o atributo somou 15, e a base já valia 4. Essa é a frase que cabe na carta de recusa do banco, e é ela que as quinhentas árvores não escrevem.
modelos-lineares-e15escolha umaAjustar um modelo linear é escolher
Ponha a reta à mão
modelos-lineares-l1Cada segmento cinza é um resíduo: a distância vertical de um ponto até a sua reta.
Minimize no olho até o número parar de cair, ligue "Ver os quadrados" para ver que ele soma áreas, e revele a ótima.
O painel chama esse número de erro quadrático médio, ou EQM: a soma das áreas cinza, dividida pelo número de pontos.
modelos-lineares-e43responda com um númeroUma reta deixa os resíduos
O critério: minimizar o erro quadrático médio
Você já minimizou este número com a mão. Escrito com símbolos, ele é a função que o ajuste minimiza, e escolher a reta que a torna menor é o método dos mínimos quadrados:
Três convenções, a mesma reta. Muito texto escreve
, porque o meio cancela o 2 que desce ao derivar; outros minimizam a soma. Constante positiva não move o mínimo, e a reta é a mesma nas três.
Uma reta erra
- soma dos quadrados
- divisão pelo número de pontos
O EQM é
Repare no peso do terceiro ponto. Ele erra uma vez e meia mais que o primeiro e entra na soma com 9 contra 4. O
modelos-lineares-e8escolha umaTrês textos escrevem a perda como
Por que ao quadrado, e não em valor absoluto
Três razões, em ordem de honestidade:
- É diferenciável em todo ponto, o que faz o otimizador funcionar sem casos especiais. O erro absoluto, que soma o módulo do resíduo em vez do quadrado, tem um bico em zero.
- Tem solução fechada. Derivando e igualando a zero, chega-se às equações normais, um sistema linear que se resolve de uma vez.
- Pune o erro grande desproporcionalmente, o que às vezes é o que você quer e às vezes não é. Havendo outliers, o erro quadrático os persegue.
Um ponto erra por 1; o outlier erra por 10. No critério absoluto o segundo pesa 10 vezes mais.
E no quadrático, quantas vezes?
Cem vezes. O erro decuplicou e o peso centuplicou, porque
"Persegue os outliers" deixa de ser advertência e vira aritmética: um ponto dez vezes mais distante manda cem vezes mais na escolha da reta. Com quatro pontos comportados e um outlier assim, a reta obedece ao outlier, e o EQM cai ao ceder a ele.
É o que o item 3 quer dizer com decisão de modelagem. Trocar para o erro absoluto devolve a proporção de dez para um, ao custo de perder o bico diferenciável e a solução fechada dos itens 1 e 2.
modelos-lineares-e1escolha umaPor que a regressão linear minimiza o erro ao quadrado em vez do erro absoluto?
Escolher entre duas retas, sem derivada nenhuma
Três pontos:
A primeira é
Nenhuma derivada apareceu aqui. O critério é uma conta de aritmética que qualquer pessoa refaz, e é por isso que ele arbitra.
A segunda reta é
- resíduos
- soma dos quadrados
- EQM
A segunda vence, com
Guarde essa estranheza, porque ela é o método inteiro em miniatura: o critério não premia o acerto isolado, premia a soma. E guarde a reta
modelos-lineares-e44responda com um númeroUma terceira candidata entra na disputa, nos mesmos pontos
A dedução, em cinco passos
Por que existe uma reta ótima única, e como o computador a encontra sem tentar todas?
A reta é a mesma
Passo 1 — por que há um mínimo, e um só
Duas pessoas arrastam a reta do laboratório a partir de posições bem diferentes, até o EQM parar de cair.
Onde elas param?
Na mesma reta. A convexidade é o que garante isso: uma tigela não tem um segundo fundo onde alguém possa ficar preso, então o ponto de partida muda o caminho e nunca o destino.
Guarde a exceção, porque ela chega logo. Essa garantia é propriedade da perda com este modelo, e não do gradiente: numa rede neural a superfície deixa de ser tigela, o ponto de partida passa a importar, e é por isso que lá se fala em inicialização.
modelos-lineares-e17escolha umaPor que a convexidade de
Passo 2 — no fundo, as derivadas se anulam
Derivando em relação a
onde
A condição de mínimo em
Como se sai daí para "a reta passa por
Divida a soma por
A ideia reaproveitável é a passagem: uma condição sobre a soma vira uma afirmação sobre a média, e média é uma coordenada. Foi assim que uma igualdade algébrica virou um fato geométrico que se vê no laboratório.
Vale para qualquer conjunto, com ou sem outlier. Gire a reta ótima em torno de um ponto e ele será
modelos-lineares-e10responda com um númeroUma reta de mínimos quadrados tem inclinação
Qual é o intercepto
Passo 3 — a segunda condição
Derivando em relação a
Os resíduos são ortogonais ao atributo. O que sobrou de erro não tem mais nada de linear em
As duas condições do mínimo, uma sob a outra, trazem o resíduo multiplicado por coisas diferentes:
Por que o
Pela regra da cadeia. O resíduo é
Daí sai o significado geométrico. Na condição de
É a mesma regra de atribuição de culpa que o perceptron usa no capítulo III.1: quem não entrou na conta não responde pelo erro.
modelos-lineares-e18complete a lacunaNuma reta já ajustada por mínimos quadrados, some os produtos de cada atributo pelo seu resíduo,
Passo 4 — resolver o sistema
Substituindo
Duas contas, uma soma de produtos e uma soma de quadrados, e a reta está pronta. Sem iteração, sem taxa de aprendizado, sem critério de parada.
O numerador soma produtos de dois desvios; o denominador soma quadrados de um só.
Por que o denominador tem quadrado, se o numerador tem produto?
Porque ele é um produto, com
A leitura que a simetria entrega é a fração inteira: em cima, quanto
E ela já avisa onde vai quebrar. Se
modelos-lineares-e19responda com um númeroUm conjunto tem três pontos cujos desvios em
Calcule a inclinação
Uma vez com número
Três pontos: (1, 3), (2, 5) e (3, 4). As médias são
Logo
Agora os pontos são (0, 1), (1, 2) e (2, 6):
- S_xy
- S_xx
- a
- b
A reta é
Repare no que mudou em relação ao exemplo de cima. O
modelos-lineares-e7responda com um númeroQuatro pontos: (1, 2), (2, 3), (3, 5) e (4, 6). Calcule a inclinação
Passo 5 — o que a fórmula avisa
O denominador é a variação de
Uma barraca vendeu limonada por quarenta dias e cobrou 0,30 por copo em todos eles. Você quer ajustar vendas contra preco.
Quanto vale
Zero. Todo
A fração
Guarde este número, porque o caso da limonada é uma versão disfarçada dele: lá o preço varia no ano inteiro e não varia dentro de nenhum mês, que é onde a comparação justa teria de acontecer.
modelos-lineares-e11escolha umaAo ajustar uma reta, o denominador
O andaime sai
No cartão do exemplo trabalhado, a conta veio pronta. No desvanecido, uma parte veio pronta. Aqui não vem nada: quatro pontos, quatro linhas em branco, e a mesma receita de sempre.
Se a sua conta bater com a resposta, você não decorou uma fórmula. Você executou um procedimento, que é o que a próxima parte do capítulo vai começar a esticar.
Os pontos são
- médias
- S_xy
- S_xx
- a e b
A reta é
Se alguma linha não bateu, vale saber qual costuma falhar. A primeira raramente falha. A segunda falha quando se usam os valores brutos no lugar dos desvios, e é o único engano que muda a resposta de verdade.
modelos-lineares-e45responda com um númeroUma equipe decide ajustar uma reta que passa pela origem:
Refaça a dedução para esse modelo, derivando e igualando a zero, e calcule
De um atributo para vários
A dedução inteira foi feita com um atributo, porque assim a conta cabe na página. Um modelo de trabalho soma muitos:
São
O que sobrevive à passagem é o raciocínio inteiro: o critério continua sendo o EQM, a rota continua sendo derivar e igualar a zero, e a superfície continua sendo uma tigela. O que muda é a contagem: em vez de duas condições de mínimo há
Um modelo linear com intercepto é ajustado sobre 50 atributos.
Quantas condições de mínimo o sistema tem?
51. Uma derivada parcial por parâmetro, igualada a zero: 50 para os pesos e uma para o intercepto, que continua sendo estimado como os outros.
Repare no que isso faz com o custo. Duas condições se resolvem à mão; 51 pedem um método de resolver sistemas, e é aí que a escolha entre a álgebra e o gradiente deixa de ser acadêmica.
modelos-lineares-e46escolha umaPassando de um atributo para
Quando duas colunas dizem quase a mesma coisa
Com muitos atributos aparece um problema que não existia com um: duas colunas podem carregar quase a mesma informação. Uma barraca que distribui mais panfletos nos dias quentes tem panfletos e temperatura subindo juntas, e nenhuma das duas varia sozinha.
Isso se chama colinearidade. Ela não estraga a previsão: se muitas combinações de pesos dão quase o mesmo erro, o erro de validação não muda. O que ela deforma é a superfície que o otimizador percorre.
Muitas combinações de pesos dão quase o mesmo erro.
Que forma isso dá à superfície de erro?
Um vale comprido e estreito. Ao longo da direção em que os dois pesos se compensam o erro quase não muda, e na direção perpendicular ele sobe rápido.
A opção dos vários fundos é a confusão que o passo 1 já resolveu: a superfície continua convexa, com um fundo só. O que mudou não foi o número de mínimos, foi a forma ao redor dele, e o gradiente desce a parede em vez de andar pelo fundo.
modelos-lineares-e47escolha umaNo passo 5,
Padronizar muda a forma, não o modelo
Padronizar é pôr cada atributo na mesma escala: de cada valor subtrai-se a média da coluna e divide-se pelo desvio. Não é higiene de planilha: é o que transforma o vale estreito do cartão anterior num vale redondo.
A álgebra não anda por superfície nenhuma. Ela iguala as derivadas a zero e resolve o sistema, e o vale estreito lhe dá o mesmo trabalho que o redondo. O capítulo II.4 retoma esta superfície pelo lado da taxa de aprendizado.
O mesmo conjunto é ajustado duas vezes: como veio, e padronizado.
O que muda entre os dois ajustes?
Os coeficientes mudam, e a previsão não. Cada coeficiente é "quanto muda a resposta por unidade do atributo", e padronizar troca a unidade: onde antes era "por grau", passa a ser "por desvio-padrão de temperatura".
A função ajustada continua a mesma, e é isso que faz padronizar ser reversível. Quem espera previsão melhor está pedindo à mudança de escala uma coisa que ela não faz: o que ela facilita é o caminho do otimizador, e o que ela permite é comparar coeficientes entre atributos.
modelos-lineares-e20escolha umaDois atributos quase colineares deixam a superfície num vale estreito, e padronizar a deixa redonda. Por que a solução fechada devolve a resposta exata nos dois casos?
O gradiente contra a álgebra
Agora as duas rotas no mesmo dado, com dois atributos quase colineares. O placar mede o excesso sobre o ótimo fechado.
modelos-lineares-l2Trezentos pontos, 4 000 passos. Rode como os atributos vieram, depois padronizados.
Arrisque o número antes de conferir.
Padronizados os atributos, em que passo o excesso cai abaixo de 1%?
No passo 1 460. Como os atributos vieram, o gradiente não chega: termina 2,8% acima ao fim dos 4 000 passos, e não por passo mal escolhido, já que cada regime roda com o maior passo estável que a própria superfície admite.
modelos-lineares-e26escolha umaO que serve de referência para o zero do placar?
A solução fechada existe. Por que, então, gradiente?
Você acabou de ver o gradiente gastar 1 460 passos para alcançar um lugar que a álgebra já ocupava desde o primeiro instante. A pergunta é legítima, e é a mesma que um aluno faz em voz alta: então por que aprender o gradiente?
A solução fechada está implementada na etapa 05, em 25 linhas de eliminação de Gauss. Vale conferir: gradiente e solução fechada chegam ao mesmo lugar, com diferença menor que 0,05 em cada coeficiente. Isso desmistifica o gradiente, que passa a ser um jeito de resolver, não o jeito.
No experimento do livro, gradiente e solução fechada param a menos de 0,05 um do outro em cada coeficiente.
O que essa coincidência autoriza você a concluir, e o que ela não autoriza?
Ela autoriza confiar no procedimento. O gradiente, bem configurado, chega aonde a álgebra chega, e aqueles 0,05 são resíduo de critério de parada, não desacordo de resposta.
O que ela não autoriza é generalizar a garantia. A conferência só foi possível porque este modelo tem resposta exata para servir de régua. Na regressão logística não há régua nenhuma, e é lá que a confiança construída aqui vai ser gasta.
É o padrão que vale além deste capítulo: calibre a ferramenta geral onde existe resposta exata, e leve a calibração para onde não existe.
modelos-lineares-e9escolha umaSe a solução fechada das equações normais é exata e existe, por que o livro ensina o gradiente?
Interpretar coeficientes — e o que eles não dizem
O modelo linear é interpretável, e é por isso que ele sobrevive em crédito, seguro e saúde. Mas "interpretável" não significa "fácil de interpretar corretamente".
O que o coeficiente diz
Aumentar
Na regressão logística a leitura é outra: o coeficiente multiplica a razão de chances, não a saída. Confundir as duas é o erro de interpretação mais comum deste livro.
Um modelo de aluguel saiu assim, com a área em metros quadrados:
Quanto muda a previsão entre dois imóveis que diferem em 10 m²?
350 reais, de
É esse o gesto que torna o coeficiente uma frase: multiplique pelo tamanho da mudança que interessa à decisão. E note que a frase honesta é sobre comparar dois imóveis do conjunto, não sobre derrubar uma parede, porque o modelo viu áreas diferentes e nunca viu uma reforma.
modelos-lineares-e21responda com um númeroUm modelo prevê o limite de crédito em reais, com a renda em reais e os dependentes em pessoas:
limite = 500 + 0,12 · renda − 800 · dependentes
Comparando dois clientes, um com 2 000 reais a mais de renda e um dependente a mais que o outro, quanto muda o limite previsto?
O caso da limonada
O conjunto em ml-zero/dados/limonada/ traz 365 dias de uma barraca.
Preço cobrado e copos vendidos andam juntos nestes 365 dias.
Com que sinal?
Positivamente, e forte: +0,513. Quem previu negativo aplicou a teoria econômica correta ao dado errado, e é exatamente esse o susto que o caso existe para dar.
Guarde a estranheza sem explicá-la ainda. Uma correlação positiva significa que, nos dias em que a barraca cobrou mais, ela também vendeu mais. Alguma coisa está acontecendo junto com o preço, e o resto desta parte é descobrir o quê.
| atributo | correlação com vendas |
|---|---|
temperatura |
+0,990 |
precipitacao |
−0,909 |
panfletos |
+0,805 |
preco |
+0,513 |
Calor vende, chuva atrapalha, panfleto ajuda. E preço mais alto vende mais.
modelos-lineares-l3A primeira das cinco voltas do painel.
modelos-lineares-e22responda com um númeroClique em Ajustar e responda o coeficiente de preco, com uma casa.
O preço é um termômetro disfarçado
| preço | dias | temperatura média* | vendas médias | meses em que aparece |
|---|---|---|---|---|
| 0,30 | 303 | 57,0 | 23,7 | jan–jun, set–dez |
| 0,50 | 62 | 78,8 | 33,1 | só julho e agosto |
* A unidade não está no arquivo. A faixa (15,1 a 102,9) é típica de Fahrenheit.
modelos-lineares-l4Marque temperatura e ajuste de novo.
O preço de 0,50 aparece em 62 dias, todos em julho e agosto.
Escreva o que esse fato faz com a correlação de +0,513.
Ele a explica inteira. A coluna preco tem dois valores, e o valor alto é um carimbo de julho e agosto. Comparar vendas a 0,50 com vendas a 0,30 é comparar verão com o resto do ano, e a correlação mede o calor de julho.
preco não é uma alavanca de decisão neste conjunto: é um termômetro disfarçado. A pergunta da dona da barraca, quanto vendo a mais se eu baixar o preço, exigiria dias comparáveis com preços diferentes, e não existe um só.
A ideia reaproveitável: uma coluna que só assume certo valor dentro de um recorte não mede o que o nome dela diz, mede o recorte.
modelos-lineares-e23responda com um númeroCom temperatura marcada, responda o coeficiente de preco, com duas casas.
O passo que deveria salvar, e não salva
A resposta de manual é controlar pelas outras variáveis: marque as duas que faltam.
modelos-lineares-l5Marque as duas caixas e ajuste. Uma linha nova aparece embaixo.
Ela é o coeficiente de determinação, o
vendas que o modelo reproduz, de 0 (prever sempre a média) a 1 (acertar cada ponto). Ele sai altíssimo, e é por ser altíssimo que está aqui.
Do preço 0,30 para o 0,50 a venda sobe 9,4 copos, e a temperatura sobe de 57,0 para 78,8. Complete as duas parcelas:
- temperatura:
0,3692 × (78,8 − 57,0) - preço:
2,4143 × (0,50 − 0,30)
A temperatura responde por 8,05 dos 9,4 copos, e o preço por 0,48, cinco por cento da diferença. O que sobra está na precipitação e nos panfletos, que também mudam de janeiro para julho.
Repare no contraste: +2,4143 é o maior coeficiente da equação, e mesmo assim a parcela dele é a menor de todas. Coeficiente é efeito por unidade; parcela é efeito por unidade vezes a variação que de fato existiu no dado. O preço variou 0,20 em 365 dias; a temperatura variou 21,8.
São as duas armadilhas deste capítulo na mesma conta. Coeficiente grande não é atributo importante enquanto não se padroniza, e aqueles 0,20 de variação de preço só aconteceram em julho e agosto.
modelos-lineares-e24responda com um númeroCom as quatro colunas no ajuste, responda o
O coeficiente do preço continua positivo: a temperatura média não captura ser julho, e o que sobrou de julho mora dentro de preco.
Um confundidor é a variável que mexe nas outras duas e cria associação sem causa. Aqui ele é "ser julho", e ninguém o mediu: controlar por uma variável só remove o confundimento que aquela variável mede.
modelos-lineares-l6alta_temporada vale 1 nos 62 dias de julho e agosto, e 0 nos outros 303.
A temperatura entrou no modelo e o coeficiente do preço continuou positivo.
O que "ser julho" tem que "78,8 graus" não tem?
Férias escolares, fluxo de rua diferente, hábito de quem passa, dias mais longos. Um dia de 78,8 graus em maio não traz nada disso, e é essa diferença que sobra sem dono no modelo.
O que sobra sem dono não some: é atribuído ao atributo que marcar melhor o recorte, e aqui o único que marca julho é o preço. O coeficiente de 2,4143 é a estação inteira empacotada num nome errado.
A ideia reaproveitável: controlar por um indicador do confundidor não é controlar pelo confundidor. Antes de escrever "controlamos por X", pergunte quanto de X ficou de fora da medida de X.
modelos-lineares-e5responda com um númeroMarque alta_temporada e ajuste: o painel recusa. Desmarque preco, ajuste de novo, e responda o coeficiente de alta_temporada, com três casas.
O panfleto, de brinde
Vem outro de brinde: temperatura e panfletos correlacionam +0,798, porque em dia quente distribuíam-se mais panfletos. O coeficiente do panfleto sai em 0,0188, e lido como efeito da panfletagem é falso.
Colinearidade não estraga a previsão. Estraga a leitura, porque o erro de validação não muda.
modelos-lineares-l7O corte escolhe quantos dias entram. Mexa nele e ajuste de novo.
Suponha que a barraca passasse a distribuir a mesma quantidade de panfletos em dia frio e em dia quente, e que o modelo fosse reajustado.
Escreva o que aconteceria com o coeficiente de panfletos, e por quê.
Ele desceria. Hoje o panfleto aparece junto do calor e leva crédito por vendas que o calor explicaria sozinho; distribuindo panfleto em dia frio também, essa carona acaba.
Quem respondeu "ficaria igual" fez a aposta que o cartão anterior desmontou: a temperatura está no modelo, e ainda assim não captura tudo o que anda junto dela.
E há um hábito a levar daqui. Inverter o coeficiente devolve a unidade que a decisão usa: 0,0188 copo por panfleto vira 1 ÷ 0,0188 ≈ 53 panfletos por copo. "0,0188" não diz nada a quem manda imprimir; "53 panfletos por copo" diz, e diz que a panfletagem provavelmente não se paga. Com o número honesto, ela se pagaria menos ainda.
modelos-lineares-e4responda com um númeroPonha o corte em 200 e ajuste. Responda o coeficiente de panfletos, com quatro casas.
O conserto óbvio
O conserto de manual seria isolar um período em que o preço varie sem a estação variar junto: recortar um mês, onde o calor é parecido dia após dia.
modelos-lineares-l8Escolha um mês e ajuste. Depois tente outro, e outro.
O painel recusa nos doze, e o aviso é o do passo 5: em cada mês o preço tem um valor só, então
A pergunta da dona da barraca não tem resposta nestes 365 dias.
Descreva a coleta que teria respondido a ela.
Alternar os dois preços dentro do mesmo mês, de preferência sorteando o preço de cada dia. Assim o preço deixa de andar junto com a estação, e a diferença de vendas entre dias parecidos passa a ser atribuível a ele.
Repare no que muda de lugar. A solução não está na análise, está na coleta, e nenhuma técnica aplicada depois inventa a variação que ninguém produziu.
É por isso que o experimento é caro e vale o preço. Quem controla a atribuição do tratamento compra a única coisa que a observação não vende.
modelos-lineares-e27responda com um númeroRecorte julho, desmarque preco e ajuste. Responda o
Mão na massa
A etapa 05–06 do ml-zero implementa, em biblioteca padrão, a RegressaoLinear com os dois caminhos (solução fechada por eliminação de Gauss e gradiente), e o Padronizador, que aprende no treino e aplica ao teste.
O notebook refaz a análise dos últimos cartões célula a célula, e a última delas traz um # TODO. É ali que este cartão cobra alguma coisa: você altera um número, roda, e traz o resultado de volta para o exercício.
Notebook pronto para executar — regressao_limonada.ipynb · abrir no Colab
O Padronizador guarda a média e o desvio de cada atributo para poder reescalar os dados.
De onde ele tira esses números?
Só do treino. Aplicar ao teste os números aprendidos no treino é o que mantém o teste intocado.
As outras duas opções são a mesma falha com roupas diferentes. Calcular no conjunto inteiro deixa a média do teste entrar no treino, e padronizar cada conjunto com os próprios números faz o modelo receber, na hora de avaliar, uma escala que ele nunca viu. Nos dois casos o número final fica melhor do que a realidade, que é o vazamento do capítulo I.3.
modelos-lineares-e48responda com um númeroAbra o notebook e vá até a célula marcada com # TODO. Troque corte = 300 por corte = 250: o modelo passa a treinar nos 250 primeiros dias e a ser avaliado nos 115 últimos. Rode e responda o R² no teste, com três casas decimais.
As quatro coisas que ele não diz
As quatro, como lista de conferência:
- Não diz causalidade. "Mantendo tudo mais constante" é operação sobre a equação, não intervenção no mundo.
- Não é comparável sem padronização. Um coeficiente de 0,003 para renda e 2,5 para filhos não diz que filhos importam mais.
- Não é confiável sob colinearidade. Atributos que andam juntos trocam peso entre si.
- Não vale fora da faixa observada. Extrapolar é usar a reta onde ela nunca viu dado: a 120 graus ela continua traçando, e o absurdo sai com aparência de rigor.
Um painel com erro de treino, erro de validação e R², todo verde.
Quais dos quatro itens acima esse painel detectaria?
Nenhum. Todos os quatro são falhas de leitura, e a métrica mede acerto de previsão. A limonada é a prova em números: R² de 0,982 com o coeficiente do preço invertido de sinal.
É por isso que a lista existe como lista, e não como alerta automático. Não há portão que a cobre, e a única defesa é alguém perguntar, antes de escrever a recomendação, de onde veio a variação de cada atributo.
A ideia reaproveitável vale muito além da regressão: um sistema só avisa sobre aquilo que ele mede, e a pergunta cara é sempre quais erros ele não é capaz de perceber.
modelos-lineares-e12escolha umaNum modelo de crédito, renda_declarada e renda_comprovada são quase idênticas. Com 200 linhas novas no treino, o coeficiente de um foi de +0,8 para −0,4, e o do outro fez o inverso. O erro de teste não mudou. Qual limitação isto ilustra?
Quando o linear é a escolha certa
Não como consolo, e sim como decisão de engenharia.
Uma pergunta que só tem resposta boa se você pensar no sistema inteiro, e não no placar.
Descreva uma situação em que você escolheria o linear sabendo que ele vai prever pior.
Há pelo menos cinco, e o cartão seguinte as lista: poucos dados por atributo, exigência de auditoria, probabilidade que vira dinheiro, linha de base obrigatória e latência apertada.
O que as cinco têm em comum é o que a resposta fraca não vê: nenhuma delas aparece na métrica de teste. Latência, auditabilidade e calibração são requisitos do sistema, e nenhuma métrica de acerto sabe que eles existem.
Se a sua resposta foi "quando os dados são poucos", você achou a linha mais citada e a menos interessante. As outras quatro é que decidem projeto de verdade.
modelos-lineares-e41complete a lacunaComplete: as cinco linhas da tabela seguinte são ______ do sistema, e é por isso que nenhuma delas aparece na métrica de teste.
| Situação | Por quê |
|---|---|
| Poucos dados por atributo | menos parâmetros, menos variância: com 200 linhas e 50 colunas, o ensemble decora |
| Necessidade de auditoria | um número por atributo, defensável. Exigência regulatória em crédito e seguro |
| Probabilidade que vira dinheiro | sai razoavelmente calibrado; ensembles frequentemente não (cap. II.1) |
| Linha de base obrigatória | é a régua contra a qual o modelo complexo se justifica |
| Latência apertada | uma multiplicação de vetores, muito mais rápida que uma floresta |
Quatro linhas da tabela só entram quando a restrição correspondente existe. Uma vale sempre.
Escreva qual é, e o que ela responde que as outras quatro não respondem.
Linha de base obrigatória. As outras quatro dependem do contexto: só valem se houver pouco dado, regulador, dinheiro multiplicado ou prazo de resposta.
A linha de base não depende de nada disso. Ela responde "quanto do sinal é simplesmente linear?", e essa pergunta existe em todo problema, inclusive naqueles em que o linear vai perder feio no fim.
Se a sua frase nomeou a linha certa e parou aí, falta a metade que decide. O que a torna incondicional é a pergunta que ela responde vir antes da comparação, e não depender de quem ficou na frente no teste.
modelos-lineares-e25escolha umaUm time tem 15 000 linhas, 8 atributos, nenhuma exigência de auditoria e nenhum limite de latência. O que a tabela diz sobre a escolha?
Duas linhas da tabela, por dentro
Duas das cinco escondem um mecanismo, e é o mecanismo que decide.
Poucos dados por atributo. Com 50 colunas o linear estima 51 números. Um ensemble de árvores estima uma estrutura muito maior a partir das mesmas linhas, e sobra amostra para cada corte decorar ruído.
Probabilidade que vira dinheiro. O linear sai razoavelmente calibrado, e ensembles frequentemente precisam de correção posterior (capítulo II.1). Ordenar bem e acertar o valor são exigências diferentes, e só a segunda sobrevive a uma multiplicação.
Um conjunto tem 200 linhas e 50 colunas, e você compara um linear com um ensemble.
Escreva quem tende a ir melhor no teste, e faça a contagem que sustenta a sua resposta.
O linear, e a razão é contagem. Com 50 colunas ele estima 51 números; o ensemble estima uma estrutura muito maior a partir das mesmas 200 linhas, e sobra amostra para cada corte decorar ruído.
Não é uma lei, é uma tendência com mecanismo conhecido: quanto mais o modelo tem a estimar, mais dado ele precisa para estimar bem. É o mesmo raciocínio de viés e variância do capítulo 0.2, aplicado à escolha da família.
modelos-lineares-e30escolha umaUma equipe multiplica a probabilidade prevista pelo valor da apólice para provisionar. Por que a calibração pesa mais que a ordenação?
O caso da seguradora
Quatro restrições numa proposta só, e nenhuma delas é sobre acertar mais. Uma seguradora precisa de um modelo treinado em 300 apólices com 40 atributos, com resposta em menos de 10 ms, justificativa por escrito ao regulador em cada recusa, e a probabilidade multiplicada pelo valor da apólice para calcular a provisão.
A comparação que a equipe pretende fazer é por AUC (area under the curve, área sob a curva), a métrica que o capítulo II.1 apresenta: a probabilidade de um caso positivo sorteado ao acaso receber escore maior que um negativo sorteado ao acaso. Ela mede ordenação, e só ordenação.
Sobre a proposta acima, com as quatro restrições postas lado a lado.
Quais dessas quatro restrições apareceriam numa comparação feita só por AUC?
Só a primeira, e mesmo assim de lado: com 300 linhas e 40 atributos o ensemble decora, e isso chega à AUC de teste como variância alta entre partições.
As outras três são invisíveis para qualquer métrica de acerto. Latência é engenharia, auditabilidade é regulação, e calibração é uma propriedade da probabilidade que a AUC ignora por construção, porque ela só olha ordenação.
É o argumento inteiro do capítulo numa frase: escolher modelo pelo placar é escolher olhando um quarto do problema.
modelos-lineares-e14escolha todas que valemAinda no caso da seguradora acima: quais dessas restrições, sozinhas, já apontam para o modelo linear? (marque todas que valem)
Treine sempre um linear primeiro
A linha de base tem um corolário que vale sozinho: sempre treine um linear primeiro. Ele custa minutos e responde à pergunta anterior a todas as outras, que é "quanto do sinal é simplesmente linear?".
E o contraexemplo honesto, para o corolário não virar fé: no capítulo II.5 o linear faz 0,4963 de AUC contra 0,9392 do boosting, num dado de fronteira irregular.
Você treinou o linear, treinou o complexo depois, e no mesmo teste o ganho do segundo foi pequeno.
Escreva o que esse resultado revelou, e a decisão de engenharia que ele autoriza.
Que o sinal é quase todo linear. A linha de base não serve para ser vencida: ela serve para dizer quanto de estrutura o problema tem além de uma soma ponderada.
E aí a conta vira de engenharia. O ganho pequeno é permanente, e o custo do modelo complexo também: mais dependências, mais tempo de treino, mais superfície para quebrar, e uma explicação que ninguém escreve na carta de recusa.
Quem previu "mal configurado" fez a aposta que custa semanas. Ela às vezes é verdadeira, e por isso a ordem importa: só vale investigá-la depois de a linha de base ter sido medida.
modelos-lineares-e6responda com suas palavrasAgora use tudo. A dona da barraca de limonada quer decidir o preço do próximo verão e pede ajuda. Você tem os 365 dias do conjunto e um modelo linear com
Escreva a resposta que você daria a ela, em até seis linhas, sem jargão. Diga o que o modelo serve para responder, o que ele não serve, e o que você precisaria para responder a pergunta que ela fez.
De onde isto veio
O aperto. Virada do século XVIII para o XIX, astronomia. Um cometa é observado em noites diferentes, e as observações não concordam. A órbita é uma só, e não há critério defensável para escolher a curva.
O que se fazia antes. Escolhia-se a olho. Dois astrônomos competentes chegavam a órbitas diferentes.
A virada. Trocar "a melhor curva" por uma regra explícita: a que torna mínima a soma dos quadrados dos desvios. Ela não é mais verdadeira que as outras, é pública: devolve a mesma resposta para qualquer pessoa.
O nome. Moindres carrés, mínimos quadrados, é de Legendre, e é a definição do critério.
Dois astrônomos recebem as mesmas observações e escolhem a olho.
Escreva o que eles obtêm, e diga se a média das duas escolhas resolveria.
Órbitas diferentes, e sem árbitro. O problema não era falta de dado nem falta de talento: era não existir uma regra escrita que dissesse o que "melhor curva" significa.
A opção da média parece conciliadora e não resolve nada, porque a média de duas escolhas arbitrárias continua arbitrária. Sem critério declarado, não há como preferir uma resposta, nem como reconstruir a resposta de ontem.
modelos-lineares-e31complete a lacunaEscreva o que faltava naquela astronomia: não era observação nem instrumento melhor, era uma ______ explícita do que conta como a melhor curva.
Perda é critério de arbitragem
A ideia reaproveitável. Uma função de perda é um critério de arbitragem, não uma descoberta sobre o mundo: existe para tornar a escolha reproduzível e discutível.
Legendre publicou primeiro, em 1805. Gauss publicou em 1809, afirmando usar o método desde 1795. Stigler (1981) argumenta "though not conclusively" que Gauss o possuía antes, sem conseguir comunicá-lo.
No capítulo III.1 o crédito pelo backpropagation fica com quem reinventou por último. Os dois casos dizem: crédito não segue descoberta, segue comunicação.
Uma equipe passa a minimizar o erro absoluto, nos mesmos dados.
Escreva o que essa equipe está trocando, e o que continua exatamente igual.
O critério. A família de modelos continua a mesma reta, e o que muda é a regra que decide qual reta ganha, porque o absoluto pesa o ponto distante dez vezes onde o quadrático pesa cem.
A opção do "nada de essencial" é a confusão que a seção existe para desfazer. Perda não é uma propriedade do mundo que se descobre: é uma escolha declarada, e por isso trocá-la é decisão de projeto que precisa ser justificada e registrada.
modelos-lineares-e35escolha umaO que o resumo de Stigler, como o capítulo o cita, permite afirmar?
Procedência das afirmações desta seção:
| Selo | Afirmação |
|---|---|
| ✓ᵐ | Legendre (1805) e Gauss (1809): obra, ano e conteúdo geral. Nenhuma das duas lida no original |
| ✓ᵃ | A tese que Stigler declara e o trecho citado entre aspas, do resumo de "Gauss and the Invention of Least Squares", Annals of Statistics 9(3):465–474, 1981, 10.1214/aos/1176345451 — resumo lido no original; o corpo, não |
| ⏳ | As notas de Olbers (1816) e Bessel (1832), e o ataque público de Legendre em 1820. O resumo de Stigler fala em "new evidence, both documentary and statistical", sem nomear quais |
| 📖 | A ideia reaproveitável ("perda é critério de arbitragem") e a ligação com o capítulo III.1 |
"Perda é critério de arbitragem" é a frase que este capítulo mais quer que você leve embora.
Escreva que selo ela leva na tabela, e o que o selo escolhido nega sobre ela.
📖. Nenhum documento de 1805 diz "função de perda é critério de arbitragem": a frase é a interpretação que este livro faz do que aconteceu, e vender interpretação como fato histórico é uma das três proibições da casa.
Repare que o selo não enfraquece a ideia. Ele diz de onde ela vem, e é justamente por vir de leitura editorial que ela pode ser discutida sem que ninguém precise abrir um arquivo de 1805.
modelos-lineares-e37complete a lacuna"Perda é critério de arbitragem" não é afirmação de fonte histórica: é ______ deste livro, e o selo 📖 existe para dizer isso.
Síntese — o que levar
- Regressão linear minimiza erro quadrático por diferenciabilidade e solução fechada, não por ser intrinsecamente mais correto.
- A dedução dá duas condições: a soma dos resíduos é zero, e os resíduos são ortogonais ao atributo.
-
, e o denominador avisa: atributo que não varia não tem coeficiente. - Gradiente e solução fechada chegam ao mesmo lugar. O gradiente é a ferramenta geral; a fechada é o caso de sorte.
- Coeficiente não é causa, não é comparável sem padronização, não é estável sob colinearidade, e não vale fora da faixa observada.
- Treine sempre um linear primeiro, porque ele responde em minutos quanto do sinal é simplesmente linear.
- Uma perda é um critério de arbitragem: quem escolhe a perda escolhe o que conta como erro.
Um colega quer aprovar um ensemble para um sistema de crédito sem treinar o linear antes.
Escreva a frase que você diria a ele, usando uma das linhas acima.
A frase mais forte não é sobre acerto: é que sem a linha de base ninguém sabe quanto do ganho é real, e que um sistema de crédito ainda vai precisar de uma explicação por escrito em cada recusa.
Se a sua frase falou só de desempenho, ela perde a discussão no dia em que o ensemble ganhar por pouco. As duas que não perdem são a linha de base e a auditoria, porque nenhuma delas depende de quem ficou na frente no teste.
modelos-lineares-e39complete a lacunaComplete a síntese do capítulo: uma função de perda é um ______ de arbitragem, e não uma descoberta sobre o mundo.
Verificação
- Mostre, sem consultar o texto, por que a reta de mínimos quadrados passa necessariamente pelo ponto
. - Você tem 180 linhas e 60 atributos. Que família de modelo você tenta primeiro, e por quê?
- Dois atributos do seu modelo são quase idênticos. O erro de validação está ótimo. O que pode estar errado mesmo assim?
- No laboratório, o que aconteceria com a reta ótima se todos os pontos tivessem o mesmo
? Responda pela fórmula, não pelo desenho.
Responda a questão 1 antes de revelar, com as suas palavras.
Por que a reta ótima passa por
No mínimo, a derivada da perda em relação a
Compare com o que você escreveu. Se o seu argumento partiu do desenho, ou de "faz sentido que passe pelo meio", ele não é uma demonstração: o que fecha a questão é a condição de primeira ordem, e nada além dela.
modelos-lineares-e40responda com um númeroQuestão 3, na célula 8.1 do notebook. Troque arredondar para True e rode: entra uma cópia da temperatura, arredondada ao grau. Responda o coeficiente de temperatura, com quatro casas.
modelos-lineares-e50responda com um númeroQuestão 4, na célula 8.2 do mesmo notebook. Ponha mes = 7 e rode: sai o
temperatura, arredondado à unidade.