# II.2 — Modelos Lineares

> **Estado da arte capturado em 2026-08** · última revisão 2026-09-01 · [histórico](../HISTORICO.md)
>
> **Nível: essencial.** Corpo escrito e prática funcionando; o aprofundamento (experimento próprio, todas as fontes conferidas, cláusula de expiração) vem em ciclo próprio — ver [níveis de maturidade](../GUIA-EDITORIAL.md#niveis-de-maturidade).

:::cartao {"nivel":1,"titulo":"O que este capítulo cobra","apresenta":["Regressão linear","Regressão logística","Coeficiente","Inclinação","Intercepto"],"herdado":["Atributo","Parâmetro","Métrica","Variância","Correlação","Outlier","Ensemble","Calibração","Limiar","Razão de chances","Taxa de aprendizado","Gradiente descendente"]}

## Objetivos de aprendizagem

Um modelo linear soma [atributos](../glossario.md#termos-fundamentais): cada um entra multiplicado por um número seu, e um deslocamento fecha a conta. Cada um desses números é um **[coeficiente](../glossario.md#diagnostico-e-leitura-do-modelo)**. Com um atributo só, o coeficiente se chama **[inclinação](../glossario.md#regressao-linear)** e o deslocamento se chama **[intercepto](../glossario.md#regressao-linear)**.

- **O1.** Derivar a [regressão linear](../glossario.md#regressao-linear) como minimização do erro quadrático.
- **O2.** Calcular a inclinação e o intercepto ótimos a partir de duas somas.
- **O3.** Interpretar os coeficientes de um modelo linear, e dizer o que eles **não** significam.
- **O4.** Decidir, sob as restrições do sistema, quando o modelo linear é a escolha certa.
- **O5.** Distinguir, numa afirmação histórica, o que a fonte sustenta do que é leitura deste livro.

Só de regressão linear. A **[regressão logística](../glossario.md#regressao-linear)**, que tem "regressão" no nome e classifica, tem capítulo próprio: [II.3](ii-3-regressao-logistica.md).

:::interacao {"id":"modelos-lineares-i40","tipo":"prever","titulo":"Quantos números o modelo estima","numero":4}
Um modelo linear é ajustado sobre três atributos.

> **pergunta:** Quantos números ele precisa estimar?
> **revela:** **Quatro.** Um coeficiente por atributo, e mais o intercepto, que não pertence a atributo nenhum.
>
> Quem respondeu três esqueceu o deslocamento, e ele é estimado como os outros: ninguém o entrega pronto. Guarde a contagem, porque ela volta como argumento de escolha de modelo no fim do capítulo.
:::

:::exercicio {"id":"modelos-lineares-e42","tipo":"completar","objetivo":"O3","dificuldade":"facil"}
Num modelo linear, o número que multiplica um atributo chama-se ______, e aprender a lê-lo sem exagerar no que ele diz é o que este capítulo cobra.

> **volte para:** #objetivos-de-aprendizagem
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":1,"titulo":"A carta de recusa que ninguém escreve"}

## O problema: o modelo que todo mundo aprende e quase ninguém respeita

Um banco precisa negar um crédito e **explicar por quê**. A lei exige a explicação, o cliente exige a explicação, e o auditor vai pedir a conta.

O modelo campeão do concurso interno, quinhentas árvores somadas, dá a melhor previsão da casa e não produz **uma única frase** que caiba na carta de recusa. Ele acerta mais e não serve.

:::interacao {"id":"modelos-lineares-i26","tipo":"principio","titulo":"Acerta mais e não serve"}
O [ensemble](../glossario.md#diagnostico-e-leitura-do-modelo) ganhou o concurso interno por uma margem confortável de acerto.

> **pergunta:** Escreva por que isso não basta para ele ser aprovado neste banco.
> **revela:** Porque o requisito não é acerto, é **explicação por escrito**, e ele não está no placar. Um modelo que erra um pouco mais e escreve a frase atende ao cliente, ao regulador e ao auditor; o campeão não atende a nenhum dos três.
>
> O erro de raciocínio que isto desfaz é tratar a métrica como se ela fosse o problema inteiro. A métrica é uma das restrições, e a mais fácil de medir, e por isso ela ocupa a conversa toda.
>
> A ideia reaproveitável vale fora de crédito: **antes de comparar modelos, escreva a lista de requisitos que a comparação não enxerga.**
:::

:::exercicio {"id":"modelos-lineares-e29","tipo":"multipla","objetivo":"O4","dificuldade":"facil"}
No caso do banco, por que o modelo mais preciso é recusado?

- [ ] Porque quinhentas árvores custam caro demais para treinar todo mês.
- [ ] Porque a precisão dele foi medida errada e não se sustenta no teste.
- [ ] Porque a lei proíbe usar aprendizado de máquina em decisão de crédito.
- [ ] Porque a recusa exige explicação por escrito, e ele não escreve nenhuma.

> **volte para:** #o-problema-o-modelo-que-todo-mundo-aprende-e-quase-ninguem-respeita
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":1,"titulo":"O modelo é uma reta"}

## Fundamentos: regressão linear como minimização

Comece pelo caso menor, que é onde a conta cabe inteira: **um [atributo](../glossario.md#termos-fundamentais) só**. Aí o modelo é uma reta, com a [inclinação](../glossario.md#regressao-linear) $a$ e o [intercepto](../glossario.md#regressao-linear) $b$.

$$\hat{y} = ax + b$$

O chapéu marca o que o modelo produz, e sem chapéu o $y$ é o que o mundo entregou. São $n$ exemplos.

A dedução inteira acontece nesta reta de um atributo. A forma com muitos atributos volta mais adiante, e nada do que for deduzido aqui se perde na passagem.

:::interacao {"id":"modelos-lineares-i4","tipo":"prever","titulo":"A conta que a reta faz","numero":19}
Um modelo de uma entrada saiu do ajuste com $a = 2{,}5$ e $b = 4$. Chega um exemplo com $x = 6$.

> **pergunta:** Quanto vale $\hat{y}$?
> **revela:** **19**, de $2{,}5 \times 6 + 4 = 15 + 4$. O atributo entra uma vez, multiplicado pela inclinação, e o intercepto entra sozinho.
>
> Repare no que a forma permite dizer em voz alta: o atributo somou 15, e a base já valia 4. Essa é a frase que cabe na carta de recusa do banco, e é ela que as quinhentas árvores não escrevem.
:::

:::exercicio {"id":"modelos-lineares-e15","tipo":"multipla","objetivo":"O1","dificuldade":"facil"}
Ajustar um modelo linear é escolher $a$ e $b$. Para saber se uma escolha é melhor que outra, o que precisa ser comparado?

- [ ] O tamanho dos pesos, porque peso grande costuma indicar atributo importante.
- [ ] A quantidade de atributos contra a quantidade de exemplos disponíveis.
- [ ] A previsão do modelo contra o valor observado, exemplo por exemplo.
- [ ] Os atributos entre si, para descobrir qual deles domina a escala.

> **volte para:** #fundamentos-regressao-linear-como-minimizacao
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":1,"titulo":"Ponha a reta à mão","apresenta":["Resíduo","EQM"]}

## Ponha a reta à mão

:::lab {"id":"modelos-lineares-l1","tipo":"regressao-linear","titulo":"Mínimos quadrados à mão","n":24,"a":1.8,"b":4,"ruido":3.2}
Cada segmento cinza é um **[resíduo](../glossario.md#modelos-lineares)**: a distância vertical de um ponto até a **sua** reta.

**Minimize no olho** até o número parar de cair, **ligue "Ver os quadrados"** para ver que ele soma áreas, e **revele a ótima**.
:::

O painel chama esse número de **[erro quadrático médio](../glossario.md#regressao-linear)**, ou **EQM**: a soma das áreas cinza, dividida pelo número de pontos.

:::exercicio {"id":"modelos-lineares-e43","tipo":"numerica","objetivo":"O1","dificuldade":"facil"}
Uma reta deixa os resíduos $-1$, $+2$, $-2$ e $+3$. Qual é a **soma das áreas** dos quadrados?

> **volte para:** #ponha-a-reta-a-mao
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":1,"titulo":"O critério: erro quadrático médio","apresenta":["Mínimos quadrados"]}

### O critério: minimizar o erro quadrático médio

Você já minimizou este número com a mão. Escrito com símbolos, ele é a função que o ajuste minimiza, e escolher a reta que a torna menor é o método dos **[mínimos quadrados](../glossario.md#regressao-linear)**:

$$L(a, b) = \frac{1}{n}\sum_{i=1}^{n}\left(y_i - \hat{y}_i\right)^2$$

> **Três convenções, a mesma reta.** Muito texto escreve $\frac{1}{2n}$, porque o meio cancela o 2 que desce ao derivar; outros minimizam a **soma**. Constante positiva não move o mínimo, e a reta é a mesma nas três.

:::interacao {"id":"modelos-lineares-i5","tipo":"desvanecido","titulo":"O EQM de três pontos"}
Uma reta erra $+2$, $-1$ e $+3$ nos três pontos do conjunto. Complete a conta:

- [?] soma dos quadrados => 4 + 1 + 9 = 14
- [?] divisão pelo número de pontos => 14 / 3

> **revela:** O EQM é $14/3 \approx 4{,}67$. O sinal some no quadrado, e é por isso que errar para cima e errar para baixo não se cancelam.
>
> Repare no peso do terceiro ponto. Ele erra uma vez e meia mais que o primeiro e entra na soma com 9 contra 4. O $\frac{1}{n}$ devolve o número a uma escala comparável entre conjuntos de tamanhos diferentes, e é só isso que ele faz.
:::

:::exercicio {"id":"modelos-lineares-e8","tipo":"multipla","objetivo":"O1","dificuldade":"facil"}
Três textos escrevem a perda como $\frac{1}{n}\sum(y-\hat{y})^2$, $\frac{1}{2n}\sum(y-\hat{y})^2$ e $\sum(y-\hat{y})^2$. O que muda entre eles?

- [ ] Só o número do painel: o mínimo não anda.
- [ ] A reta ótima, diferente em cada convenção.
- [ ] A necessidade de otimização iterativa.
- [ ] O grau do polinômio que se ajusta aos dados.

> **volte para:** #o-criterio-minimizar-o-erro-quadratico-medio
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":1,"titulo":"Por que ao quadrado, e não em valor absoluto","apresenta":["Erro absoluto","Solução fechada","Equações normais"]}

### Por que ao quadrado, e não em valor absoluto

Três razões, em ordem de honestidade:

1. **É diferenciável em todo ponto**, o que faz o otimizador funcionar sem casos especiais. O **[erro absoluto](../glossario.md#regressao-linear)**, que soma o módulo do [resíduo](../glossario.md#modelos-lineares) em vez do quadrado, tem um bico em zero.
2. **Tem [solução fechada](../glossario.md#regressao-linear).** Derivando e igualando a zero, chega-se às *[equações normais](../glossario.md#modelos-lineares)*, um sistema linear que se resolve de uma vez.
3. **Pune o erro grande desproporcionalmente**, o que às vezes é o que você quer e às vezes não é. Havendo *[outliers](../glossario.md#estatistica-descritiva-e-exploracao)*, o erro quadrático os persegue.

:::interacao {"id":"modelos-lineares-i1","tipo":"prever","titulo":"O peso do ponto distante","numero":100}
Um ponto erra por **1**; o *outlier* erra por **10**. No critério absoluto o segundo pesa 10 vezes mais.

> **pergunta:** E no quadrático, quantas vezes?
> **revela:** **Cem vezes.** O erro decuplicou e o peso centuplicou, porque $10^2 = 100$ contra $1^2 = 1$. Quem previu 10 leu o critério certo, o absoluto, e é justamente essa a diferença entre os dois.
>
> "Persegue os *outliers*" deixa de ser advertência e vira aritmética: um ponto dez vezes mais distante manda cem vezes mais na escolha da reta. Com quatro pontos comportados e um *outlier* assim, a reta obedece ao *outlier*, e o EQM cai ao ceder a ele.
>
> É o que o item 3 quer dizer com decisão de modelagem. Trocar para o erro absoluto devolve a proporção de dez para um, ao custo de perder o bico diferenciável e a solução fechada dos itens 1 e 2.
:::

:::exercicio {"id":"modelos-lineares-e1","tipo":"multipla","objetivo":"O1","dificuldade":"media"}
Por que a [regressão linear](../glossario.md#regressao-linear) minimiza o erro **ao quadrado** em vez do erro absoluto?

- [ ] Porque o erro quadrático é sempre menor que o erro absoluto.
- [ ] Porque é diferenciável em todo ponto e admite solução fechada exata.
- [ ] Porque o erro absoluto não pode ser minimizado por nenhum método.
- [ ] Porque o quadrado elimina os erros negativos, e o absoluto não.

> **volte para:** #por-que-ao-quadrado-e-nao-em-valor-absoluto
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":1,"titulo":"A mesma reta, com três números"}

### Escolher entre duas retas, sem derivada nenhuma

Três pontos: $(1, 3)$, $(2, 5)$ e $(3, 4)$. Duas retas candidatas, e o critério decidindo entre elas.

A primeira é $\hat{y} = x + 2$. Ela prevê 3, 4 e 5; os [resíduos](../glossario.md#modelos-lineares) são $0$, $+1$ e $-1$; os quadrados são $0$, $1$ e $1$. O EQM é $2/3 \approx 0{,}67$.

Nenhuma derivada apareceu aqui. O critério é uma conta de aritmética que qualquer pessoa refaz, e é por isso que ele arbitra.

:::interacao {"id":"modelos-lineares-i41","tipo":"desvanecido","titulo":"A segunda candidata"}
A segunda reta é $\hat{y} = 0{,}5x + 3$, e ela prevê $3{,}5$, $4$ e $4{,}5$ nos mesmos três pontos. Complete:

- [?] resíduos => -0,5 · +1 · -0,5
- [?] soma dos quadrados => 0,25 + 1 + 0,25 = 1,5
- [?] EQM => 1,5 / 3 = 0,5

> **revela:** A segunda vence, com $0{,}50$ contra $0{,}67$. Ela erra em todos os três pontos, e mesmo assim erra menos no total que a primeira, que acertou um em cheio.
>
> Guarde essa estranheza, porque ela é o método inteiro em miniatura: o critério não premia o acerto isolado, premia a soma. E guarde a reta $\hat{y} = 0{,}5x + 3$, porque daqui a seis cartões a álgebra vai devolvê-la sem que ninguém precise testar candidata nenhuma.
:::

:::exercicio {"id":"modelos-lineares-e44","tipo":"numerica","objetivo":"O1","dificuldade":"media"}
Uma terceira candidata entra na disputa, nos mesmos pontos $(1, 3)$, $(2, 5)$ e $(3, 4)$: a reta $\hat{y} = 2x$. Calcule o EQM dela, com duas casas decimais.

> **volte para:** #escolher-entre-duas-retas-sem-derivada-nenhuma
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":2,"titulo":"Passo 1 — a tigela tem um fundo só","apresenta":["Convexidade"]}

## A dedução, em cinco passos

Por que existe uma reta ótima única, e como o computador a encontra sem tentar todas?

A reta é a mesma $\hat{y} = ax + b$ do cartão dos fundamentos, e o critério é o mesmo EQM. Escrito com a reta dentro:

$$L(a, b) = \frac{1}{n}\sum_{i=1}^{n}\left(y_i - ax_i - b\right)^2$$

### Passo 1 — por que há um mínimo, e um só

$L$ é uma soma de quadrados: a tigela que você percorreu no laboratório, [convexa](../glossario.md#regressao-linear) em $(a, b)$. Tigela tem um fundo, e só um.

:::interacao {"id":"modelos-lineares-i7","tipo":"prever","titulo":"Dois começos, um destino"}
Duas pessoas arrastam a reta do laboratório a partir de posições bem diferentes, até o EQM parar de cair.

- ( ) Em retas diferentes: o começo decide.
- ( ) Em retas diferentes: há mínimos locais.
- (!) Na mesma reta: há um fundo só.

> **pergunta:** Onde elas param?
> **revela:** Na **mesma reta**. A convexidade é o que garante isso: uma tigela não tem um segundo fundo onde alguém possa ficar preso, então o ponto de partida muda o caminho e nunca o destino.
>
> Guarde a exceção, porque ela chega logo. Essa garantia é propriedade da **perda com este modelo**, e não do gradiente: numa rede neural a superfície deixa de ser tigela, o ponto de partida passa a importar, e é por isso que lá se fala em inicialização.
:::

:::exercicio {"id":"modelos-lineares-e17","tipo":"multipla","objetivo":"O1","dificuldade":"facil"}
Por que a convexidade de $L$ torna o ajuste confiável?

- [ ] Garante erro pequeno no fundo da tigela.
- [ ] Permite trocar o quadrático pelo absoluto.
- [ ] Dispensa escolher o passo do otimizador.
- [ ] Garante um mínimo só, para todo caminho.

> **volte para:** #passo-1-por-que-ha-um-minimo-e-um-so
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":2,"titulo":"Passo 2 — a reta passa pelo centro de massa"}

### Passo 2 — no fundo, as derivadas se anulam

Derivando em relação a $b$:

$$\frac{\partial L}{\partial b} = -\frac{2}{n}\sum_{i=1}^{n}\left(y_i - ax_i - b\right) = 0$$

$$\Longrightarrow\; \sum_{i=1}^{n} r_i = 0$$

onde $r_i = y_i - ax_i - b$ é o [resíduo](../glossario.md#modelos-lineares). **A soma dos resíduos é zero.** Dividindo por $n$: $\bar{y} = a\bar{x} + b$, ou seja, $b = \bar{y} - a\bar{x}$.

:::interacao {"id":"modelos-lineares-i8","tipo":"principio","titulo":"De zero a centro de massa"}
A condição de mínimo em $b$ diz apenas que a soma dos resíduos é zero.

> **pergunta:** Como se sai daí para "a reta passa por $(\bar{x}, \bar{y})$"?
> **revela:** Divida a soma por $n$. A média dos resíduos é zero, e a média de $y_i - ax_i - b$ é $\bar{y} - a\bar{x} - b$. Igualando a zero, o ponto $(\bar{x}, \bar{y})$ satisfaz a equação da reta, e portanto está sobre ela.
>
> A ideia reaproveitável é a passagem: **uma condição sobre a soma vira uma afirmação sobre a média**, e média é uma coordenada. Foi assim que uma igualdade algébrica virou um fato geométrico que se vê no laboratório.
>
> Vale para qualquer conjunto, com ou sem *outlier*. Gire a reta ótima em torno de um ponto e ele será $(\bar{x}, \bar{y})$.
:::

:::exercicio {"id":"modelos-lineares-e10","tipo":"numerica","objetivo":"O2","dificuldade":"facil"}
Uma reta de [mínimos quadrados](../glossario.md#regressao-linear) tem [inclinação](../glossario.md#regressao-linear) $a = 2{,}5$. As médias dos dados são $\bar{x} = 4$ e $\bar{y} = 18$.

Qual é o **[intercepto](../glossario.md#regressao-linear)** $b$?

> **volte para:** #passo-2-no-fundo-as-derivadas-se-anulam
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":2,"titulo":"Passo 3 — os resíduos são ortogonais ao atributo","apresenta":["Ortogonalidade"]}

### Passo 3 — a segunda condição

Derivando em relação a $a$:

$$\frac{\partial L}{\partial a} = -\frac{2}{n}\sum_{i=1}^{n}x_i\left(y_i - ax_i - b\right) = 0$$

$$\Longrightarrow\; \sum_{i=1}^{n} x_i r_i = 0$$

**Os resíduos são ortogonais ao atributo.** O que sobrou de erro **não tem mais nada de linear em $x$**: se tivesse, a reta ainda poderia melhorar.

:::interacao {"id":"modelos-lineares-i2","tipo":"principio","titulo":"De onde sai o xᵢ"}
As duas condições do mínimo, uma sob a outra, trazem o resíduo multiplicado por coisas diferentes:

$$\frac{\partial L}{\partial b} = -\frac{2}{n}\sum_{i} r_i$$

$$\frac{\partial L}{\partial a} = -\frac{2}{n}\sum_{i} x_i\, r_i$$

> **pergunta:** Por que o $x_i$ aparece ao derivar em relação a $a$, e não em relação a $b$?
> **revela:** Pela regra da cadeia. O resíduo é $r_i = y_i - ax_i - b$: derivado em relação a $b$ ele dá $-1$, e em relação a $a$ dá $-x_i$. O que multiplica cada resíduo é **a sensibilidade daquele resíduo ao parâmetro**, e ela é $x_i$ porque é $x_i$ que multiplica $a$ na reta.
>
> Daí sai o significado geométrico. Na condição de $b$ todo ponto pesa igual, e por isso ela vira "a soma dos resíduos é zero". Na condição de $a$ cada ponto pesa o próprio $x_i$: ponto com $x$ grande manda muito na inclinação, e ponto com $x = 0$ não opina sobre ela.
>
> É a mesma regra de atribuição de culpa que o perceptron usa no [capítulo III.1](iii-1-neuronio-artificial.md): quem não entrou na conta não responde pelo erro.
:::

:::exercicio {"id":"modelos-lineares-e18","tipo":"completar","objetivo":"O2","dificuldade":"media"}
Numa reta já ajustada por [mínimos quadrados](../glossario.md#regressao-linear), some os produtos de cada atributo pelo seu resíduo, $\sum_i x_i r_i$. O resultado vale sempre ______.

> **volte para:** #passo-3-a-segunda-condicao
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":2,"titulo":"Passo 4 — duas somas, e a reta está pronta"}

### Passo 4 — resolver o sistema

Substituindo $b = \bar{y} - a\bar{x}$ na segunda condição e reorganizando em torno das médias:

$$a = \frac{\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})}{\sum_{i=1}^{n}(x_i - \bar{x})^2} = \frac{S_{xy}}{S_{xx}}$$

Duas contas, uma soma de produtos e uma soma de quadrados, e a reta está pronta. Sem iteração, sem [taxa de aprendizado](../glossario.md#regressao-linear), sem critério de parada.

:::interacao {"id":"modelos-lineares-i10","tipo":"principio","titulo":"Produto em cima, quadrado embaixo"}
O numerador soma produtos de dois desvios; o denominador soma quadrados de um só.

> **pergunta:** Por que o denominador tem quadrado, se o numerador tem produto?
> **revela:** Porque ele **é** um produto, com $x$ nos dois lugares: $S_{xx} = \sum (x_i - \bar{x})(x_i - \bar{x})$. Trocar $y$ por $x$ no numerador dá o denominador, e o quadrado é só o nome curto disso.
>
> A leitura que a simetria entrega é a fração inteira: em cima, quanto $x$ e $y$ variam **juntos**; embaixo, quanto $x$ varia **sozinho**. A inclinação é o tanto de $y$ que se ganha por unidade de variação de $x$.
>
> E ela já avisa onde vai quebrar. Se $x$ não varia sozinho, o denominador é zero, e é isso que o passo 5 vai cobrar.
:::

:::exercicio {"id":"modelos-lineares-e19","tipo":"numerica","objetivo":"O2","dificuldade":"media"}
Um conjunto tem três pontos cujos desvios em $x$ são $-2$, $0$ e $+2$, e cujos desvios em $y$ são $-3$, $0$ e $+3$.

Calcule a **[inclinação](../glossario.md#regressao-linear)** $a$ da reta de [mínimos quadrados](../glossario.md#regressao-linear). Responda com duas casas decimais.

> **volte para:** #passo-4-resolver-o-sistema
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":2,"titulo":"Uma vez com número"}

### Uma vez com número

Três pontos: (1, 3), (2, 5) e (3, 4). As médias são $\bar{x} = 2$ e $\bar{y} = 4$. Os desvios em $x$ são $-1$, $0$, $+1$; em $y$, $-1$, $+1$, $0$.

$$S_{xy} = (-1)(-1) + (0)(1) + (1)(0) = 1$$

$$S_{xx} = 1 + 0 + 1 = 2$$

Logo $a = 1/2 = 0{,}5$, e $b = 4 - 0{,}5 \times 2 = 3$. A reta é $\hat{y} = 0{,}5x + 3$, e passa por $(2, 4)$.

:::interacao {"id":"modelos-lineares-i11","tipo":"desvanecido","titulo":"O mesmo caminho, outros três pontos"}
Agora os pontos são (0, 1), (1, 2) e (2, 6): $\bar{x} = 1$, $\bar{y} = 3$, desvios em $x$ de $-1$, $0$, $+1$ e em $y$ de $-2$, $-1$, $+3$.

- [?] S_xy => (-1)(-2) + (0)(-1) + (1)(3) = 5
- [?] S_xx => 1 + 0 + 1 = 2
- [?] a => 5 / 2 = 2,5
- [?] b => 3 - 2,5 x 1 = 0,5

> **revela:** A reta é $\hat{y} = 2{,}5x + 0{,}5$, e o teste de sempre confere: em $x = 1$ ela dá 3, que é $\bar{y}$.
>
> Repare no que mudou em relação ao exemplo de cima. O $S_{xx}$ é o mesmo 2, porque os $x$ são os mesmos; o que subiu foi o $S_{xy}$, de 1 para 5, porque o terceiro ponto saiu bem mais alto.
:::

:::exercicio {"id":"modelos-lineares-e7","tipo":"numerica","objetivo":"O2","dificuldade":"media"}
Quatro pontos: (1, 2), (2, 3), (3, 5) e (4, 6). Calcule a **[inclinação](../glossario.md#regressao-linear)** $a$ da reta de [mínimos quadrados](../glossario.md#regressao-linear), com duas casas decimais.

> **volte para:** #uma-vez-com-numero
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":2,"titulo":"Passo 5 — o denominador avisa"}

### Passo 5 — o que a fórmula avisa

O denominador é a variação de $x$. Se $S_{xx} = 0$, todos os $x$ são iguais, e **não existe reta**: nenhuma [inclinação](../glossario.md#regressao-linear) é melhor que outra. Não é falha numérica, é o dado não conter a informação.

:::interacao {"id":"modelos-lineares-i12","tipo":"prever","titulo":"Quarenta dias pelo mesmo preço","numero":0}
Uma barraca vendeu limonada por quarenta dias e cobrou 0,30 por copo em todos eles. Você quer ajustar `vendas` contra `preco`.

> **pergunta:** Quanto vale $S_{xx}$ do preço?
> **revela:** **Zero.** Todo $x_i$ é igual a $\bar{x}$, então todo desvio é zero, e a soma dos quadrados de zeros é zero.
>
> A fração $S_{xy}/S_{xx}$ fica sem resposta, e o que a álgebra está dizendo é uma frase sobre o mundo: **atributo que não varia não tem coeficiente.** Não há como saber o efeito de mudar o preço se ninguém nunca o mudou.
>
> Guarde este número, porque o caso da limonada é uma versão disfarçada dele: lá o preço varia no ano inteiro e não varia dentro de nenhum mês, que é onde a comparação justa teria de acontecer.
:::

:::exercicio {"id":"modelos-lineares-e11","tipo":"multipla","objetivo":"O2","dificuldade":"dificil"}
Ao ajustar uma reta, o denominador $S_{xx}$ dá zero. O que isso significa?

- [ ] Erro numérico de arredondamento, corrigível com mais precisão na conta.
- [ ] Que o modelo está perfeitamente ajustado, e o erro nos pontos é zero.
- [ ] Que todos os $y$ são iguais, e a reta ótima fica horizontal.
- [ ] Que todos os $x$ são iguais, e nenhuma inclinação é melhor que outra.

> **volte para:** #passo-5-o-que-a-formula-avisa
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":2,"titulo":"A conta inteira é sua"}

### O andaime sai

No cartão do exemplo trabalhado, a conta veio pronta. No desvanecido, uma parte veio pronta. Aqui não vem nada: quatro pontos, quatro linhas em branco, e a mesma receita de sempre.

Se a sua conta bater com a resposta, você não decorou uma fórmula. Você executou um procedimento, que é o que a próxima parte do capítulo vai começar a esticar.

:::interacao {"id":"modelos-lineares-i42","tipo":"desvanecido","titulo":"Quatro pontos, nenhuma linha pronta"}
Os pontos são $(2, 4)$, $(4, 9)$, $(6, 11)$ e $(8, 16)$. Faça as quatro linhas:

- [?] médias => x̄ = 5 · ȳ = 10
- [?] S_xy => (-3)(-6) + (-1)(-1) + (1)(1) + (3)(6) = 38
- [?] S_xx => 9 + 1 + 1 + 9 = 20
- [?] a e b => a = 38 / 20 = 1,9 · b = 10 - 1,9 × 5 = 0,5

> **revela:** A reta é $\hat{y} = 1{,}9x + 0{,}5$, e o teste de sempre confere: em $x = 5$ ela dá 10, que é $\bar{y}$.
>
> Se alguma linha não bateu, vale saber qual costuma falhar. A primeira raramente falha. A segunda falha quando se usam os valores brutos no lugar dos desvios, e é o único engano que muda a resposta de verdade.
:::

:::exercicio {"id":"modelos-lineares-e45","tipo":"numerica","objetivo":"O1","dificuldade":"dificil"}
Uma equipe decide ajustar uma reta **que passa pela origem**: $\hat{y} = ax$, sem [intercepto](../glossario.md#regressao-linear) nenhum. A perda vira $L(a) = \frac{1}{n}\sum_i (y_i - ax_i)^2$, com um [parâmetro](../glossario.md#termos-fundamentais) só.

Refaça a dedução para esse modelo, derivando e igualando a zero, e calcule $a$ para os pontos $(1, 2)$, $(2, 3)$ e $(3, 7)$. Responda com duas casas decimais.

> **volte para:** #o-andaime-sai
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":3,"titulo":"De um atributo para vários"}

## De um atributo para vários

A dedução inteira foi feita com um atributo, porque assim a conta cabe na página. Um modelo de trabalho soma muitos:

$$\hat{y} = w_1x_1 + w_2x_2 + \dots + w_dx_d + b$$

São $n$ exemplos e $d$ atributos, e $w_j$ é o [coeficiente](../glossario.md#diagnostico-e-leitura-do-modelo) do atributo $j$. Com um atributo só, $w_1$ é a [inclinação](../glossario.md#regressao-linear) $a$ que você vinha calculando.

O que sobrevive à passagem é o raciocínio inteiro: o critério continua sendo o EQM, a rota continua sendo derivar e igualar a zero, e a superfície continua sendo uma tigela. O que muda é a **contagem**: em vez de duas condições de mínimo há $d + 1$, uma por [parâmetro](../glossario.md#termos-fundamentais), e resolvê-las deixa de caber numa linha.

:::interacao {"id":"modelos-lineares-i43","tipo":"prever","titulo":"Cinquenta atributos, quantas condições","numero":51}
Um modelo linear com [intercepto](../glossario.md#regressao-linear) é ajustado sobre 50 atributos.

> **pergunta:** Quantas condições de mínimo o sistema tem?
> **revela:** **51.** Uma derivada parcial por parâmetro, igualada a zero: 50 para os pesos e uma para o intercepto, que continua sendo estimado como os outros.
>
> Repare no que isso faz com o custo. Duas condições se resolvem à mão; 51 pedem um método de resolver sistemas, e é aí que a escolha entre a álgebra e o gradiente deixa de ser acadêmica.
:::

:::exercicio {"id":"modelos-lineares-e46","tipo":"multipla","objetivo":"O1","dificuldade":"facil"}
Passando de um atributo para $d$, o que deixa de valer da dedução que você acabou de fazer?

- [ ] Nada: muda a contagem das condições, de duas para $d + 1$.
- [ ] A convexidade, porque com muitos atributos surgem mínimos locais.
- [ ] A condição de que a soma dos resíduos é zero no ajuste ótimo.
- [ ] O critério, porque com muitos atributos usa-se o erro absoluto.

> **volte para:** #de-um-atributo-para-varios
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":3,"titulo":"Dois atributos que andam juntos","apresenta":["Colinearidade"]}

### Quando duas colunas dizem quase a mesma coisa

Com muitos atributos aparece um problema que não existia com um: duas colunas podem carregar quase a mesma informação. Uma barraca que distribui mais panfletos nos dias quentes tem `panfletos` e `temperatura` subindo juntas, e nenhuma das duas varia sozinha.

Isso se chama **[colinearidade](../glossario.md#modelos-lineares)**. Ela não estraga a previsão: se muitas combinações de pesos dão quase o mesmo erro, o erro de validação não muda. O que ela deforma é a superfície que o otimizador percorre.

:::interacao {"id":"modelos-lineares-i23","tipo":"prever","titulo":"A forma que dois atributos colineares desenham"}
Muitas combinações de pesos dão quase o mesmo erro.

- ( ) Uma tigela redonda como antes.
- (!) Um vale comprido e estreito.
- ( ) Uma superfície com vários fundos.

> **pergunta:** Que forma isso dá à superfície de erro?
> **revela:** Um **vale comprido e estreito**. Ao longo da direção em que os dois pesos se compensam o erro quase não muda, e na direção perpendicular ele sobe rápido.
>
> A opção dos vários fundos é a confusão que o passo 1 já resolveu: a superfície continua convexa, com um fundo só. O que mudou não foi o número de mínimos, foi a **forma** ao redor dele, e o gradiente desce a parede em vez de andar pelo fundo.
:::

:::exercicio {"id":"modelos-lineares-e47","tipo":"multipla","objetivo":"O2","dificuldade":"media"}
No passo 5, $S_{xx} = 0$ deixava a reta sem existir. Sob colinearidade, o que acontece com a conta?

- [ ] Ela também não fecha: o sistema fica sem solução, como com $S_{xx} = 0$.
- [ ] Ela fecha, e muitas combinações de pesos dão quase o mesmo erro.
- [ ] Ela fecha, e o erro de previsão piora de forma mensurável.
- [ ] Ela fecha, e os coeficientes saem todos iguais entre si.

> **volte para:** #quando-duas-colunas-dizem-quase-a-mesma-coisa
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":3,"titulo":"Padronizar muda a forma, não o modelo","apresenta":["Padronização"]}

### Padronizar muda a forma, não o modelo

**Padronizar** é pôr cada [atributo](../glossario.md#termos-fundamentais) na mesma escala: de cada valor subtrai-se a média da coluna e divide-se pelo desvio. Não é higiene de planilha: é o que transforma o vale estreito do cartão anterior num vale redondo.

A álgebra não anda por superfície nenhuma. Ela iguala as derivadas a zero e resolve o sistema, e o vale estreito lhe dá o mesmo trabalho que o redondo. O capítulo [II.4](ii-4-otimizacao.md) retoma esta superfície pelo lado da [taxa de aprendizado](../glossario.md#regressao-linear).

:::interacao {"id":"modelos-lineares-i44","tipo":"prever","titulo":"O que padronizar muda no resultado"}
O mesmo conjunto é ajustado duas vezes: como veio, e padronizado.

- ( ) Nada: o ajuste sai igual.
- (!) Os coeficientes mudam, e a previsão não.
- ( ) A previsão muda, e o modelo melhora.

> **pergunta:** O que muda entre os dois ajustes?
> **revela:** **Os coeficientes mudam, e a previsão não.** Cada coeficiente é "quanto muda a resposta por unidade do atributo", e padronizar troca a unidade: onde antes era "por grau", passa a ser "por desvio-padrão de temperatura".
>
> A função ajustada continua a mesma, e é isso que faz padronizar ser reversível. Quem espera previsão melhor está pedindo à mudança de escala uma coisa que ela não faz: o que ela facilita é o caminho do otimizador, e o que ela permite é comparar coeficientes entre atributos.
:::

:::exercicio {"id":"modelos-lineares-e20","tipo":"multipla","objetivo":"O2","dificuldade":"media"}
Dois atributos quase [colineares](../glossario.md#modelos-lineares) deixam a superfície num vale estreito, e padronizar a deixa redonda. Por que a [solução fechada](../glossario.md#regressao-linear) devolve a resposta exata **nos dois casos**?

- [ ] Padronizar não altera os coeficientes ótimos.
- [ ] As equações normais resolvem o sistema sem andar pela superfície.
- [ ] O dado padronizado deixa de ser correlacionado entre si.
- [ ] A álgebra usa um passo maior a cada iteração.

> **volte para:** #padronizar-muda-a-forma-nao-o-modelo
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":3,"titulo":"O gradiente contra a álgebra"}

### O gradiente contra a álgebra

Agora as duas rotas no mesmo dado, com dois [atributos](../glossario.md#termos-fundamentais) quase [colineares](../glossario.md#modelos-lineares). O placar mede o **excesso sobre o ótimo fechado**.

:::lab {"id":"modelos-lineares-l2","tipo":"anima-normais","titulo":"O gradiente atrás de uma resposta que já existe"}
Trezentos pontos, 4 000 passos. Rode como os atributos vieram, depois padronizados.
:::

:::interacao {"id":"modelos-lineares-i39","tipo":"prever","titulo":"Quantos passos","numero":1460,"tolerancia":500}
Arrisque o número antes de conferir.

> **pergunta:** Padronizados os atributos, em que passo o excesso cai abaixo de 1%?
> **revela:** No passo **1 460**. Como os atributos vieram, o gradiente **não chega**: termina 2,8% acima ao fim dos 4 000 passos, e não por passo mal escolhido, já que cada regime roda com o maior passo estável que a própria superfície admite.
:::

:::exercicio {"id":"modelos-lineares-e26","tipo":"multipla","objetivo":"O2","dificuldade":"media"}
O que serve de referência para o zero do placar?

- [ ] O menor erro do próprio gradiente.
- [ ] O erro que as equações normais devolvem.
- [ ] O erro de quem prevê sempre a média.
- [ ] O erro num teste separado.

> **volte para:** #o-gradiente-contra-a-algebra
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":3,"titulo":"A fechada existe, e ainda assim o gradiente"}

### A solução fechada existe. Por que, então, gradiente?

Você acabou de ver o gradiente gastar 1 460 passos para alcançar um lugar que a álgebra já ocupava desde o primeiro instante. A pergunta é legítima, e é a mesma que um aluno faz em voz alta: então por que aprender o gradiente?

A solução fechada está implementada na [etapa 05](../trilha-ml-zero.md), em 25 linhas de eliminação de Gauss. Vale conferir: **gradiente e solução fechada chegam ao mesmo lugar**, com diferença menor que 0,05 em cada [coeficiente](../glossario.md#diagnostico-e-leitura-do-modelo). Isso desmistifica o gradiente, que passa a ser *um jeito* de resolver, não *o* jeito.

:::interacao {"id":"modelos-lineares-i6","tipo":"principio","titulo":"Duas rotas, o mesmo lugar"}
No experimento do livro, gradiente e solução fechada param a menos de 0,05 um do outro em cada coeficiente.

> **pergunta:** O que essa coincidência autoriza você a concluir, e o que ela não autoriza?
> **revela:** Ela autoriza confiar no **procedimento**. O gradiente, bem configurado, chega aonde a álgebra chega, e aqueles 0,05 são resíduo de critério de parada, não desacordo de resposta.
>
> O que ela não autoriza é generalizar a **garantia**. A conferência só foi possível porque este modelo tem resposta exata para servir de régua. Na regressão logística não há régua nenhuma, e é lá que a confiança construída aqui vai ser gasta.
>
> É o padrão que vale além deste capítulo: calibre a ferramenta geral onde existe resposta exata, e leve a calibração para onde não existe.
:::

:::exercicio {"id":"modelos-lineares-e9","tipo":"multipla","objetivo":"O1","dificuldade":"dificil"}
Se a solução fechada das [equações normais](../glossario.md#modelos-lineares) é exata e existe, por que o livro ensina o gradiente?

- [ ] Porque o gradiente encontra um mínimo melhor que a solução fechada.
- [ ] Porque a solução fechada só vale quando os dados não têm ruído.
- [ ] Porque o gradiente é mais preciso quando existem *outliers* no conjunto.
- [ ] Porque resolver $d + 1$ equações é caro, e a logística não tem fechada.

> **volte para:** #a-solucao-fechada-existe-por-que-entao-gradiente
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":4,"titulo":"O que o coeficiente diz"}

## Interpretar coeficientes — e o que eles não dizem

O modelo linear é interpretável, e é por isso que ele sobrevive em crédito, seguro e saúde. Mas "interpretável" não significa "fácil de interpretar corretamente".

### O que o coeficiente diz

Aumentar $x_j$ em uma unidade muda $\hat{y}$ em $w_j$ unidades, mantendo os demais [atributos](../glossario.md#termos-fundamentais) constantes. É a leitura mais direta que um modelo oferece.

> Na [regressão logística](../glossario.md#regressao-linear) a leitura é outra: o coeficiente multiplica a **[razão de chances](../glossario.md#modelos-lineares)**, não a saída. Confundir as duas é o erro de interpretação mais comum deste livro.

:::interacao {"id":"modelos-lineares-i13","tipo":"prever","titulo":"Trinta e cinco por metro quadrado","numero":350}
Um modelo de aluguel saiu assim, com a área em metros quadrados: $\hat{y} = 1200 + 35\,x$.

> **pergunta:** Quanto muda a previsão entre dois imóveis que diferem em 10 m²?
> **revela:** **350 reais**, de $35 \times 10$. O intercepto some da conta, porque ele é o mesmo nos dois imóveis e a pergunta é sobre a **diferença**.
>
> É esse o gesto que torna o coeficiente uma frase: multiplique pelo tamanho da mudança que interessa à decisão. E note que a frase honesta é sobre **comparar dois imóveis do conjunto**, não sobre derrubar uma parede, porque o modelo viu áreas diferentes e nunca viu uma reforma.
:::

:::exercicio {"id":"modelos-lineares-e21","tipo":"numerica","objetivo":"O3","dificuldade":"facil"}
Um modelo prevê o limite de crédito em reais, com a renda em reais e os dependentes em pessoas:

`limite = 500 + 0,12 · renda − 800 · dependentes`

Comparando dois clientes, um com 2 000 reais a mais de renda e um dependente a mais que o outro, quanto muda o limite previsto?

> **volte para:** #o-que-o-coeficiente-diz
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":4,"titulo":"A correlação que recomenda o contrário"}

## O caso da limonada

O conjunto em [`ml-zero/dados/limonada/`](../../ml-zero/dados/limonada/README.md) traz 365 dias de uma barraca.

:::interacao {"id":"modelos-lineares-i14","tipo":"prever","titulo":"O sinal que você espera"}
Preço cobrado e copos vendidos andam juntos nestes 365 dias.

- (!) Positivamente: caro vendeu mais.
- ( ) Negativamente: caro afasta freguês.
- ( ) Perto de zero: o preço mal mudou.

> **pergunta:** Com que sinal?
> **revela:** **Positivamente**, e forte: **+0,513**. Quem previu negativo aplicou a teoria econômica correta ao dado errado, e é exatamente esse o susto que o caso existe para dar.
>
> Guarde a estranheza sem explicá-la ainda. Uma correlação positiva significa que, nos dias em que a barraca cobrou mais, ela também vendeu mais. Alguma coisa está acontecendo junto com o preço, e o resto desta parte é descobrir o quê.
:::

| [atributo](../glossario.md#termos-fundamentais) | correlação com `vendas` |
|---|---|
| `temperatura` | +0,990 |
| `precipitacao` | −0,909 |
| `panfletos` | +0,805 |
| **`preco`** | **+0,513** |

Calor vende, chuva atrapalha, panfleto ajuda. E **preço mais alto vende mais**.

:::lab {"id":"modelos-lineares-l3","tipo":"regressao-limonada","titulo":"Primeira volta","fixos":["preco"]}
A primeira das cinco voltas do painel.
:::

:::exercicio {"id":"modelos-lineares-e22","tipo":"numerica","objetivo":"O3","dificuldade":"media"}
Clique em **Ajustar** e responda o [coeficiente](../glossario.md#diagnostico-e-leitura-do-modelo) de `preco`, com uma casa.

> **volte para:** #o-caso-da-limonada
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":4,"titulo":"O preço é um termômetro disfarçado"}

### O preço é um termômetro disfarçado

| preço | dias | temperatura média* | vendas médias | meses em que aparece |
|---|---|---|---|---|
| 0,30 | 303 | 57,0 | 23,7 | jan–jun, set–dez |
| 0,50 | 62 | 78,8 | 33,1 | **só julho e agosto** |

> \* A unidade **não está no arquivo**. A faixa (15,1 a 102,9) é típica de Fahrenheit.

:::lab {"id":"modelos-lineares-l4","tipo":"regressao-limonada","titulo":"Segunda volta","fixos":["preco"],"escolher":["temperatura"]}
Marque `temperatura` e ajuste de novo.
:::

:::interacao {"id":"modelos-lineares-i15","tipo":"principio","titulo":"O que o preço está marcando"}
O preço de 0,50 aparece em 62 dias, todos em julho e agosto.

> **pergunta:** Escreva o que esse fato faz com a correlação de +0,513.
> **revela:** Ele a explica inteira. A coluna `preco` tem dois valores, e o valor alto é um **carimbo de julho e agosto**. Comparar vendas a 0,50 com vendas a 0,30 é comparar verão com o resto do ano, e a correlação mede o calor de julho.
>
> `preco` não é uma alavanca de decisão neste conjunto: é um **termômetro disfarçado**. A pergunta da dona da barraca, *quanto vendo a mais se eu baixar o preço*, exigiria dias comparáveis com preços diferentes, e não existe um só.
>
> A ideia reaproveitável: **uma coluna que só assume certo valor dentro de um recorte não mede o que o nome dela diz, mede o recorte.**
:::

:::exercicio {"id":"modelos-lineares-e23","tipo":"numerica","objetivo":"O3","dificuldade":"media"}
Com `temperatura` marcada, responda o [coeficiente](../glossario.md#diagnostico-e-leitura-do-modelo) de `preco`, com duas casas.

> **volte para:** #o-preco-e-um-termometro-disfarcado
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":4,"titulo":"O controle que não salva","apresenta":["Coeficiente de determinação","R²"]}

### O passo que deveria salvar, e não salva

A resposta de manual é **controlar pelas outras variáveis**: marque as duas que faltam.

:::lab {"id":"modelos-lineares-l5","tipo":"regressao-limonada","titulo":"Terceira volta","fixos":["preco","temperatura"],"escolher":["precipitacao","panfletos"],"mostrar":["r2"]}
Marque as duas caixas e ajuste. Uma linha nova aparece embaixo.
:::

Ela é o **[coeficiente de determinação](../glossario.md#diagnostico-e-leitura-do-modelo)**, o $R^2$: a fração da variação de `vendas` que o modelo reproduz, de 0 (prever sempre a média) a 1 (acertar cada ponto). Ele sai altíssimo, e é por ser altíssimo que está aqui.

:::interacao {"id":"modelos-lineares-i3","tipo":"desvanecido","titulo":"Quem explica os 9,4 copos"}
Do preço 0,30 para o 0,50 a venda sobe 9,4 copos, e a temperatura sobe de 57,0 para 78,8. Complete as duas parcelas:

- [?] temperatura: `0,3692 × (78,8 − 57,0)` => 8,05 copos
- [?] preço: `2,4143 × (0,50 − 0,30)` => 0,48 copo

> **revela:** A temperatura responde por **8,05** dos 9,4 copos, e o preço por **0,48**, cinco por cento da diferença. O que sobra está na precipitação e nos panfletos, que também mudam de janeiro para julho.
>
> Repare no contraste: **+2,4143 é o maior coeficiente da equação**, e mesmo assim a parcela dele é a menor de todas. Coeficiente é efeito por unidade; parcela é efeito por unidade vezes **a variação que de fato existiu no dado**. O preço variou 0,20 em 365 dias; a temperatura variou 21,8.
>
> São as duas armadilhas deste capítulo na mesma conta. Coeficiente grande não é atributo importante enquanto não se padroniza, e aqueles 0,20 de variação de preço só aconteceram em julho e agosto.
:::

:::exercicio {"id":"modelos-lineares-e24","tipo":"numerica","objetivo":"O3","dificuldade":"media"}
Com as quatro colunas no ajuste, responda o $R^2$, com três casas.

> **volte para:** #o-passo-que-deveria-salvar-e-nao-salva
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":4,"titulo":"Controlar remove só o que a variável mede","apresenta":["Confundidor"]}

O [coeficiente](../glossario.md#diagnostico-e-leitura-do-modelo) do preço continua **positivo**: a temperatura média não captura *ser julho*, e o que sobrou de julho mora dentro de `preco`.

Um **[confundidor](../glossario.md#estatistica-descritiva-e-exploracao)** é a variável que mexe nas outras duas e cria associação sem causa. Aqui ele é "ser julho", e ninguém o mediu: controlar por uma variável só remove o confundimento que **aquela** variável mede.

:::lab {"id":"modelos-lineares-l6","tipo":"regressao-limonada","titulo":"Quarta volta","fixos":["temperatura","precipitacao","panfletos"],"escolher":["preco","alta_temporada"],"ligados":["preco"],"mostrar":["r2"]}
`alta_temporada` vale 1 nos 62 dias de julho e agosto, e 0 nos outros 303.
:::

:::interacao {"id":"modelos-lineares-i16","tipo":"principio","titulo":"O que a temperatura não carregou"}
A temperatura entrou no modelo e o coeficiente do preço continuou positivo.

> **pergunta:** O que "ser julho" tem que "78,8 graus" não tem?
> **revela:** Férias escolares, fluxo de rua diferente, hábito de quem passa, dias mais longos. Um dia de 78,8 graus em maio não traz nada disso, e é essa diferença que sobra sem dono no modelo.
>
> O que sobra sem dono não some: é atribuído ao atributo que marcar melhor o recorte, e aqui o único que marca julho é o preço. O coeficiente de 2,4143 é a estação inteira empacotada num nome errado.
>
> A ideia reaproveitável: **controlar por um indicador do confundidor não é controlar pelo confundidor.** Antes de escrever "controlamos por X", pergunte quanto de X ficou de fora da medida de X.
:::

:::exercicio {"id":"modelos-lineares-e5","tipo":"numerica","objetivo":"O3","dificuldade":"dificil"}
Marque `alta_temporada` e ajuste: o painel recusa. Desmarque `preco`, ajuste de novo, e responda o coeficiente de `alta_temporada`, com três casas.

> **volte para:** #o-passo-que-deveria-salvar-e-nao-salva
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":5,"titulo":"O panfleto, de brinde"}

### O panfleto, de brinde

Vem outro de brinde: `temperatura` e `panfletos` correlacionam **+0,798**, porque em dia quente distribuíam-se mais panfletos. O [coeficiente](../glossario.md#diagnostico-e-leitura-do-modelo) do panfleto sai em 0,0188, e lido como efeito da panfletagem é falso.

[Colinearidade](../glossario.md#modelos-lineares) não estraga a previsão. Estraga a **leitura**, porque o erro de validação não muda.

:::lab {"id":"modelos-lineares-l7","tipo":"regressao-limonada","titulo":"Quinta volta","fixos":["preco","temperatura","precipitacao","panfletos"],"mostrar":["r2"],"corte":true}
O corte escolhe quantos dias entram. Mexa nele e ajuste de novo.
:::

:::interacao {"id":"modelos-lineares-i17","tipo":"principio","titulo":"Panfleto em dia frio"}
Suponha que a barraca passasse a distribuir a mesma quantidade de panfletos em dia frio e em dia quente, e que o modelo fosse reajustado.

> **pergunta:** Escreva o que aconteceria com o coeficiente de `panfletos`, e por quê.
> **revela:** Ele **desceria**. Hoje o panfleto aparece junto do calor e leva crédito por vendas que o calor explicaria sozinho; distribuindo panfleto em dia frio também, essa carona acaba.
>
> Quem respondeu "ficaria igual" fez a aposta que o cartão anterior desmontou: a temperatura está no modelo, e ainda assim não captura tudo o que anda junto dela.
>
> E há um hábito a levar daqui. Inverter o coeficiente devolve a unidade que a decisão usa: 0,0188 copo por panfleto vira 1 ÷ 0,0188 ≈ **53 panfletos por copo**. "0,0188" não diz nada a quem manda imprimir; "53 panfletos por copo" diz, e diz que a panfletagem provavelmente não se paga. Com o número honesto, ela se pagaria menos ainda.
:::

:::exercicio {"id":"modelos-lineares-e4","tipo":"numerica","objetivo":"O3","dificuldade":"media"}
Ponha o corte em 200 e ajuste. Responda o coeficiente de `panfletos`, com quatro casas.

> **volte para:** #o-panfleto-de-brinde
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":5,"titulo":"O conserto óbvio, e por que ele não conserta"}

### O conserto óbvio

O conserto de manual seria **isolar um período em que o preço varie sem a estação variar junto**: recortar um mês, onde o calor é parecido dia após dia.

:::lab {"id":"modelos-lineares-l8","tipo":"regressao-limonada","titulo":"Sexta volta","fixos":["temperatura","precipitacao","panfletos"],"escolher":["preco"],"ligados":["preco"],"mostrar":["r2"],"recorte":true}
Escolha um mês e ajuste. Depois tente outro, e outro.
:::

O painel recusa nos doze, e o aviso é o do passo 5: em cada mês o preço tem um valor só, então $S_{xx}$ dele é zero. O [confundimento](../glossario.md#estatistica-descritiva-e-exploracao) aqui é **perfeito**, e preço e estação são a mesma variável com dois nomes.

:::interacao {"id":"modelos-lineares-i24","tipo":"principio","titulo":"O dado que teria respondido"}
A pergunta da dona da barraca não tem resposta nestes 365 dias.

> **pergunta:** Descreva a coleta que teria respondido a ela.
> **revela:** Alternar os dois preços **dentro do mesmo mês**, de preferência sorteando o preço de cada dia. Assim o preço deixa de andar junto com a estação, e a diferença de vendas entre dias parecidos passa a ser atribuível a ele.
>
> Repare no que muda de lugar. A solução não está na análise, está na **coleta**, e nenhuma técnica aplicada depois inventa a variação que ninguém produziu.
>
> É por isso que o experimento é caro e vale o preço. Quem controla a atribuição do tratamento compra a única coisa que a observação não vende.
:::

:::exercicio {"id":"modelos-lineares-e27","tipo":"numerica","objetivo":"O3","dificuldade":"media"}
Recorte **julho**, desmarque `preco` e ajuste. Responda o $R^2$, com três casas.

> **volte para:** #o-conserto-obvio
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":5,"titulo":"Mão na massa"}

## Mão na massa

A **etapa 05–06** do [`ml-zero`](../trilha-ml-zero.md) implementa, em biblioteca padrão, a `RegressaoLinear` com os dois caminhos ([solução fechada](../glossario.md#regressao-linear) por eliminação de Gauss e [gradiente](../glossario.md#regressao-linear)), e o `Padronizador`, que aprende no treino e **aplica** ao teste.

O notebook refaz a análise dos últimos cartões célula a célula, e a última delas traz um `# TODO`. É ali que este cartão cobra alguma coisa: você altera um número, roda, e traz o resultado de volta para o exercício.

**Notebook pronto para executar** — [`regressao_limonada.ipynb`](https://github.com/GHDaru/machinelearning/blob/main/ml-zero/etapa-05/regressao_limonada.ipynb) · [abrir no Colab](https://colab.research.google.com/github/GHDaru/machinelearning/blob/main/ml-zero/etapa-05/regressao_limonada.ipynb)

:::interacao {"id":"modelos-lineares-i35","tipo":"prever","titulo":"Onde o padronizador aprende"}
O `Padronizador` guarda a média e o desvio de cada [atributo](../glossario.md#termos-fundamentais) para poder reescalar os dados.

- (!) Só no treino, e depois aplica os mesmos números ao teste.
- ( ) No conjunto inteiro, antes de separar treino e teste.
- ( ) Em cada conjunto separadamente, com os números de cada um.

> **pergunta:** De onde ele tira esses números?
> **revela:** **Só do treino.** Aplicar ao teste os números aprendidos no treino é o que mantém o teste intocado.
>
> As outras duas opções são a mesma falha com roupas diferentes. Calcular no conjunto inteiro deixa a média do teste entrar no treino, e padronizar cada conjunto com os próprios números faz o modelo receber, na hora de avaliar, uma escala que ele nunca viu. Nos dois casos o número final fica melhor do que a realidade, que é o vazamento do [capítulo I.3](i-3-dados.md).
:::

:::exercicio {"id":"modelos-lineares-e48","tipo":"numerica","objetivo":"O3","dificuldade":"dificil"}
Abra o notebook e vá até a célula marcada com `# TODO`. Troque `corte = 300` por `corte = 250`: o modelo passa a treinar nos 250 primeiros dias e a ser avaliado nos 115 últimos. Rode e responda o **R² no teste**, com três casas decimais.

> **volte para:** #mao-na-massa
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":5,"titulo":"As quatro coisas que o coeficiente não diz","apresenta":["Extrapolação"]}

### As quatro coisas que ele não diz

As quatro, como lista de conferência:

1. **Não diz causalidade.** "Mantendo tudo mais constante" é operação sobre a equação, não intervenção no mundo.
2. **Não é comparável sem [padronização](../glossario.md#regressao-linear).** Um coeficiente de 0,003 para renda e 2,5 para filhos não diz que filhos importam mais.
3. **Não é confiável sob [colinearidade](../glossario.md#modelos-lineares).** [Atributos](../glossario.md#termos-fundamentais) que andam juntos trocam peso entre si.
4. **Não vale fora da faixa observada.** [Extrapolar](../glossario.md#diagnostico-e-leitura-do-modelo) é usar a reta onde ela nunca viu dado: a 120 graus ela continua traçando, e o absurdo sai com aparência de rigor.

:::interacao {"id":"modelos-lineares-i19","tipo":"principio","titulo":"O que a métrica enxerga"}
Um painel com erro de treino, erro de validação e R², todo verde.

> **pergunta:** Quais dos quatro itens acima esse painel detectaria?
> **revela:** **Nenhum.** Todos os quatro são falhas de **leitura**, e a métrica mede acerto de previsão. A limonada é a prova em números: R² de 0,982 com o coeficiente do preço invertido de sinal.
>
> É por isso que a lista existe como lista, e não como alerta automático. Não há portão que a cobre, e a única defesa é alguém perguntar, antes de escrever a recomendação, de onde veio a variação de cada atributo.
>
> A ideia reaproveitável vale muito além da regressão: **um sistema só avisa sobre aquilo que ele mede**, e a pergunta cara é sempre quais erros ele não é capaz de perceber.
:::

:::exercicio {"id":"modelos-lineares-e12","tipo":"multipla","objetivo":"O3","dificuldade":"dificil"}
Num modelo de crédito, `renda_declarada` e `renda_comprovada` são quase idênticas. Com 200 linhas novas no treino, o coeficiente de um foi de +0,8 para −0,4, e o do outro fez o inverso. O erro de teste não mudou. Qual limitação isto ilustra?

- [ ] Não diz causalidade.
- [ ] Não é comparável entre atributos sem padronização.
- [ ] Não é confiável sob colinearidade.
- [ ] Não vale fora da faixa observada.

> **volte para:** #as-quatro-coisas-que-ele-nao-diz
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":6,"titulo":"Quando o linear é a escolha certa"}

## Quando o linear é a escolha certa

Não como consolo, e sim como decisão de engenharia.

:::interacao {"id":"modelos-lineares-i20","tipo":"principio","titulo":"Escolher o pior, de propósito"}
Uma pergunta que só tem resposta boa se você pensar no sistema inteiro, e não no placar.

> **pergunta:** Descreva uma situação em que você escolheria o linear **sabendo** que ele vai prever pior.
> **revela:** Há pelo menos cinco, e o cartão seguinte as lista: poucos dados por atributo, exigência de auditoria, probabilidade que vira dinheiro, linha de base obrigatória e latência apertada.
>
> O que as cinco têm em comum é o que a resposta fraca não vê: **nenhuma delas aparece na métrica de teste.** Latência, auditabilidade e calibração são requisitos do sistema, e nenhuma métrica de acerto sabe que eles existem.
>
> Se a sua resposta foi "quando os dados são poucos", você achou a linha mais citada e a menos interessante. As outras quatro é que decidem projeto de verdade.
:::

:::exercicio {"id":"modelos-lineares-e41","tipo":"completar","objetivo":"O4","dificuldade":"facil"}
Complete: as cinco linhas da tabela seguinte são ______ do sistema, e é por isso que nenhuma delas aparece na [métrica](../glossario.md#termos-fundamentais) de teste.

> **volte para:** #quando-o-linear-e-a-escolha-certa
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":6,"titulo":"As cinco situações, e nenhuma é o placar","apresenta":["Linha de base"]}

| Situação | Por quê |
|---|---|
| **Poucos dados por [atributo](../glossario.md#termos-fundamentais)** | menos [parâmetros](../glossario.md#termos-fundamentais), menos [variância](../glossario.md#termos-fundamentais): com 200 linhas e 50 colunas, o [ensemble](../glossario.md#diagnostico-e-leitura-do-modelo) decora |
| **Necessidade de auditoria** | um número por atributo, defensável. Exigência regulatória em crédito e seguro |
| **Probabilidade que vira dinheiro** | sai razoavelmente calibrado; ensembles frequentemente não (cap. II.1) |
| **[Linha de base](../glossario.md#termos-fundamentais) obrigatória** | é a régua contra a qual o modelo complexo se justifica |
| **Latência apertada** | uma multiplicação de vetores, muito mais rápida que uma floresta |

:::interacao {"id":"modelos-lineares-i38","tipo":"principio","titulo":"A linha que vale sempre"}
Quatro linhas da tabela só entram quando a restrição correspondente existe. Uma vale sempre.

> **pergunta:** Escreva qual é, e o que ela responde que as outras quatro não respondem.
> **revela:** **Linha de base obrigatória.** As outras quatro dependem do contexto: só valem se houver pouco dado, regulador, dinheiro multiplicado ou prazo de resposta.
>
> A linha de base não depende de nada disso. Ela responde "quanto do sinal é simplesmente linear?", e essa pergunta existe em todo problema, inclusive naqueles em que o linear vai perder feio no fim.
>
> Se a sua frase nomeou a linha certa e parou aí, falta a metade que decide. O que a torna incondicional é a pergunta que ela responde vir **antes** da comparação, e não depender de quem ficou na frente no teste.
:::

:::exercicio {"id":"modelos-lineares-e25","tipo":"multipla","objetivo":"O4","dificuldade":"media"}
Um time tem 15 000 linhas, 8 atributos, nenhuma exigência de auditoria e nenhum limite de latência. O que a tabela diz sobre a escolha?

- [ ] Nada muda: o linear vence pelas cinco linhas da tabela.
- [ ] Nenhuma se aplica: a escolha volta a ser empírica.
- [ ] O linear fica desaconselhado: há dados demais.
- [ ] A calibração deixa de importar num conjunto grande.

> **volte para:** #quando-o-linear-e-a-escolha-certa
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":6,"titulo":"Duas linhas da tabela, por dentro"}

### Duas linhas da tabela, por dentro

Duas das cinco escondem um mecanismo, e é o mecanismo que decide.

**Poucos dados por [atributo](../glossario.md#termos-fundamentais).** Com 50 colunas o linear estima 51 números. Um [ensemble](../glossario.md#diagnostico-e-leitura-do-modelo) de árvores estima uma estrutura muito maior a partir das mesmas linhas, e sobra amostra para cada corte decorar ruído.

**Probabilidade que vira dinheiro.** O linear sai razoavelmente calibrado, e ensembles frequentemente precisam de correção posterior ([capítulo II.1](ii-1-avaliacao.md)). Ordenar bem e acertar o valor são exigências diferentes, e só a segunda sobrevive a uma multiplicação.

:::interacao {"id":"modelos-lineares-i27","tipo":"principio","titulo":"Duzentas linhas, cinquenta colunas"}
Um conjunto tem 200 linhas e 50 colunas, e você compara um linear com um ensemble.

> **pergunta:** Escreva quem tende a ir melhor no teste, e faça a contagem que sustenta a sua resposta.
> **revela:** O **linear**, e a razão é contagem. Com 50 colunas ele estima 51 números; o ensemble estima uma estrutura muito maior a partir das mesmas 200 linhas, e sobra amostra para cada corte decorar ruído.
>
> Não é uma lei, é uma tendência com mecanismo conhecido: quanto mais o modelo tem a estimar, mais dado ele precisa para estimar bem. É o mesmo raciocínio de viés e variância do [capítulo 0.2](../0-2-fundamentos.md), aplicado à escolha da família.
:::

:::exercicio {"id":"modelos-lineares-e30","tipo":"multipla","objetivo":"O4","dificuldade":"media"}
Uma equipe multiplica a probabilidade prevista pelo valor da apólice para provisionar. Por que a [calibração](../glossario.md#termos-fundamentais) pesa mais que a ordenação?

- [ ] A ordenação foi substituída pela calibração.
- [ ] Provisão não aceita base estatística.
- [ ] O número é multiplicado, não só ordenado.
- [ ] Calibrar melhora a acurácia por limiar.

> **volte para:** #duas-linhas-da-tabela-por-dentro
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":6,"titulo":"O caso da seguradora","apresenta":["AUC"]}

### O caso da seguradora

Quatro restrições numa proposta só, e nenhuma delas é sobre acertar mais. Uma seguradora precisa de um modelo treinado em 300 apólices com 40 [atributos](../glossario.md#termos-fundamentais), com resposta em menos de 10 ms, justificativa por escrito ao regulador em cada recusa, e a probabilidade multiplicada pelo valor da apólice para calcular a provisão.

A comparação que a equipe pretende fazer é por **AUC** (*area under the curve*, área sob a curva), a [métrica](../glossario.md#termos-fundamentais) que o [capítulo II.1](ii-1-avaliacao.md) apresenta: a probabilidade de um caso positivo sorteado ao acaso receber escore maior que um negativo sorteado ao acaso. Ela mede **ordenação**, e só ordenação.

:::interacao {"id":"modelos-lineares-i21","tipo":"principio","titulo":"O que a AUC não vê"}
Sobre a proposta acima, com as quatro restrições postas lado a lado.

> **pergunta:** Quais dessas quatro restrições apareceriam numa comparação feita só por AUC?
> **revela:** Só a **primeira**, e mesmo assim de lado: com 300 linhas e 40 atributos o ensemble decora, e isso chega à AUC de teste como variância alta entre partições.
>
> As outras três são invisíveis para qualquer métrica de acerto. Latência é engenharia, auditabilidade é regulação, e calibração é uma propriedade da probabilidade que a AUC ignora por construção, porque ela só olha ordenação.
>
> É o argumento inteiro do capítulo numa frase: **escolher modelo pelo placar é escolher olhando um quarto do problema.**
:::

:::exercicio {"id":"modelos-lineares-e14","tipo":"multipla-multi","objetivo":"O4","dificuldade":"dificil"}
Ainda no caso da seguradora acima: quais dessas restrições, sozinhas, já apontam para o modelo linear? (marque todas que valem)

- [ ] 300 linhas para 40 atributos.
- [ ] Resposta em menos de 10 ms.
- [ ] Justificativa por escrito ao regulador.
- [ ] Probabilidade multiplicada por dinheiro.
- [ ] Nenhuma: a escolha do modelo depende só da métrica no teste.

> **volte para:** #quando-o-linear-e-a-escolha-certa
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":6,"titulo":"Treine sempre um linear primeiro"}

### Treine sempre um linear primeiro

A [linha de base](../glossario.md#termos-fundamentais) tem um corolário que vale sozinho: **sempre treine um linear primeiro**. Ele custa minutos e responde à pergunta anterior a todas as outras, que é "quanto do sinal é simplesmente linear?".

E o contraexemplo honesto, para o corolário não virar fé: no [capítulo II.5](ii-5-arvores-ensembles.md) o linear faz **0,4963 de AUC** contra **0,9392** do boosting, num dado de fronteira irregular.

:::interacao {"id":"modelos-lineares-i22","tipo":"principio","titulo":"Quando o ganho é pequeno"}
Você treinou o linear, treinou o complexo depois, e no mesmo teste o ganho do segundo foi pequeno.

> **pergunta:** Escreva o que esse resultado revelou, e a decisão de engenharia que ele autoriza.
> **revela:** Que **o sinal é quase todo linear**. A linha de base não serve para ser vencida: ela serve para dizer quanto de estrutura o problema tem além de uma soma ponderada.
>
> E aí a conta vira de engenharia. O ganho pequeno é permanente, e o custo do modelo complexo também: mais dependências, mais tempo de treino, mais superfície para quebrar, e uma explicação que ninguém escreve na carta de recusa.
>
> Quem previu "mal configurado" fez a aposta que custa semanas. Ela às vezes é verdadeira, e por isso a ordem importa: só vale investigá-la depois de a linha de base ter sido medida.
:::

:::exercicio {"id":"modelos-lineares-e6","tipo":"aberta","objetivo":"O4","dificuldade":"dificil"}
Agora use tudo. A dona da barraca de limonada quer decidir **o preço do próximo verão** e pede ajuda. Você tem os 365 dias do conjunto e um modelo linear com $R^2$ de 0,982, que é exatamente o tipo de linha de base que este cartão manda treinar primeiro.

Escreva a resposta que você daria a ela, em até seis linhas, sem jargão. Diga o que o modelo serve para responder, o que ele **não** serve, e o que você precisaria para responder a pergunta que ela fez.

> **volte para:** #treine-sempre-um-linear-primeiro
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":7,"titulo":"O aperto, e a virada"}

## De onde isto veio

**O aperto.** Virada do século XVIII para o XIX, astronomia. Um cometa é observado em noites diferentes, e as observações não concordam. A órbita é uma só, e não há critério defensável para escolher a curva.

**O que se fazia antes.** Escolhia-se a olho. Dois astrônomos competentes chegavam a órbitas diferentes.

**A virada.** Trocar "a melhor curva" por uma regra explícita: a que torna mínima a soma dos quadrados dos desvios. Ela não é mais verdadeira que as outras, é **pública**: devolve a mesma resposta para qualquer pessoa.

**O nome.** *Moindres carrés*, [mínimos quadrados](../glossario.md#regressao-linear), é de Legendre, e é a definição do critério.

:::interacao {"id":"modelos-lineares-i28","tipo":"principio","titulo":"Dois astrônomos, os mesmos dados"}
Dois astrônomos recebem as mesmas observações e escolhem a olho.

> **pergunta:** Escreva o que eles obtêm, e diga se a média das duas escolhas resolveria.
> **revela:** **Órbitas diferentes, e sem árbitro.** O problema não era falta de dado nem falta de talento: era não existir uma regra escrita que dissesse o que "melhor curva" significa.
>
> A opção da média parece conciliadora e não resolve nada, porque a média de duas escolhas arbitrárias continua arbitrária. Sem critério declarado, não há como preferir uma resposta, nem como reconstruir a resposta de ontem.
:::

:::exercicio {"id":"modelos-lineares-e31","tipo":"completar","objetivo":"O5","dificuldade":"facil"}
Escreva o que faltava naquela astronomia: não era observação nem instrumento melhor, era uma ______ explícita do que conta como a melhor curva.

> **volte para:** #de-onde-isto-veio
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":7,"titulo":"A ideia reaproveitável, e a disputa","apresenta":["Função de perda"]}

### Perda é critério de arbitragem

**A ideia reaproveitável.** Uma **[função de perda](../glossario.md#termos-fundamentais)** é um critério de arbitragem, não uma descoberta sobre o mundo: existe para tornar a escolha reproduzível e discutível.

Legendre publicou primeiro, em 1805. Gauss publicou em 1809, afirmando usar o método desde 1795. Stigler (1981) argumenta *"though not conclusively"* que Gauss o possuía antes, sem conseguir comunicá-lo.

No [capítulo III.1](iii-1-neuronio-artificial.md) o crédito pelo *backpropagation* fica com quem reinventou por último. Os dois casos dizem: **crédito não segue descoberta, segue comunicação.**

:::interacao {"id":"modelos-lineares-i30","tipo":"principio","titulo":"Trocar a perda é trocar o quê"}
Uma equipe passa a minimizar o [erro absoluto](../glossario.md#regressao-linear), nos mesmos dados.

> **pergunta:** Escreva o que essa equipe está trocando, e o que continua exatamente igual.
> **revela:** O **critério**. A família de modelos continua a mesma reta, e o que muda é a regra que decide qual reta ganha, porque o absoluto pesa o ponto distante dez vezes onde o quadrático pesa cem.
>
> A opção do "nada de essencial" é a confusão que a seção existe para desfazer. Perda não é uma propriedade do mundo que se descobre: é uma escolha declarada, e por isso trocá-la é decisão de projeto que precisa ser justificada e registrada.
:::

:::exercicio {"id":"modelos-lineares-e35","tipo":"multipla","objetivo":"O5","dificuldade":"media"}
O que o resumo de Stigler, como o capítulo o cita, permite afirmar?

- [ ] Que está provado que Gauss o possuía antes.
- [ ] Que se argumenta, sem concluir, que ele o possuía antes.
- [ ] Que Gauss não o possuía antes, e que a reivindicação dele era falsa.
- [ ] Que a comunidade da época o conhecia por Gauss.

> **volte para:** #perda-e-criterio-de-arbitragem
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":7,"titulo":"Procedência das afirmações"}

**Procedência das afirmações desta seção:**

| Selo | Afirmação |
|---|---|
| ✓ᵐ | Legendre (1805) e Gauss (1809): obra, ano e conteúdo geral. Nenhuma das duas lida no original |
| ✓ᵃ | A tese que **Stigler declara** e o trecho citado entre aspas, do resumo de ["Gauss and the Invention of Least Squares"](https://projecteuclid.org/journals/annals-of-statistics/volume-9/issue-3/Gauss-and-the-Invention-of-Least-Squares/10.1214/aos/1176345451.full), *Annals of Statistics* 9(3):465–474, 1981, [10.1214/aos/1176345451](https://doi.org/10.1214/aos/1176345451) — **resumo lido no original; o corpo, não** |
| ⏳ | As notas de Olbers (1816) e Bessel (1832), e o ataque público de Legendre em 1820. O resumo de Stigler fala em "new evidence, both documentary and statistical", **sem nomear quais** |
| 📖 | A ideia reaproveitável ("perda é critério de arbitragem") e a ligação com o capítulo III.1 |

:::interacao {"id":"modelos-lineares-i34","tipo":"principio","titulo":"O selo da ideia reaproveitável"}
"Perda é critério de arbitragem" é a frase que este capítulo mais quer que você leve embora.

> **pergunta:** Escreva que selo ela leva na tabela, e o que o selo escolhido nega sobre ela.
> **revela:** **📖.** Nenhum documento de 1805 diz "função de perda é critério de arbitragem": a frase é a interpretação que este livro faz do que aconteceu, e vender interpretação como fato histórico é uma das três proibições da casa.
>
> Repare que o selo não enfraquece a ideia. Ele diz de onde ela vem, e é justamente por vir de leitura editorial que ela pode ser discutida sem que ninguém precise abrir um arquivo de 1805.
:::

:::exercicio {"id":"modelos-lineares-e37","tipo":"completar","objetivo":"O5","dificuldade":"dificil"}
"Perda é critério de arbitragem" não é afirmação de fonte histórica: é ______ deste livro, e o selo 📖 existe para dizer isso.

> **volte para:** #de-onde-isto-veio
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":8,"titulo":"Síntese — o que levar"}

## Síntese — o que levar

- [Regressão linear](../glossario.md#regressao-linear) minimiza **erro quadrático** por diferenciabilidade e [solução fechada](../glossario.md#regressao-linear), não por ser intrinsecamente mais correto.
- A dedução dá **duas condições**: a soma dos [resíduos](../glossario.md#modelos-lineares) é zero, e os resíduos são [ortogonais](../glossario.md#regressao-linear) ao [atributo](../glossario.md#termos-fundamentais).
- $a = S_{xy}/S_{xx}$, e o denominador avisa: **atributo que não varia não tem [coeficiente](../glossario.md#diagnostico-e-leitura-do-modelo)**.
- [Gradiente](../glossario.md#regressao-linear) e solução fechada chegam ao mesmo lugar. O gradiente é a ferramenta **geral**; a fechada é o caso de sorte.
- Coeficiente **não é causa**, não é comparável sem [padronização](../glossario.md#regressao-linear), não é estável sob [colinearidade](../glossario.md#modelos-lineares), e não vale fora da faixa observada.
- Treine sempre um linear primeiro, porque ele responde em minutos quanto do sinal é simplesmente linear.
- **Uma perda é um critério de arbitragem**: quem escolhe a perda escolhe o que conta como erro.

:::interacao {"id":"modelos-lineares-i36","tipo":"principio","titulo":"A frase que você diria ao colega"}
Um colega quer aprovar um [ensemble](../glossario.md#diagnostico-e-leitura-do-modelo) para um sistema de crédito sem treinar o linear antes.

> **pergunta:** Escreva a frase que você diria a ele, usando uma das linhas acima.
> **revela:** A frase mais forte não é sobre acerto: é que **sem a linha de base ninguém sabe quanto do ganho é real**, e que um sistema de crédito ainda vai precisar de uma explicação por escrito em cada recusa.
>
> Se a sua frase falou só de desempenho, ela perde a discussão no dia em que o ensemble ganhar por pouco. As duas que não perdem são a linha de base e a auditoria, porque nenhuma delas depende de quem ficou na frente no teste.
:::

:::exercicio {"id":"modelos-lineares-e39","tipo":"completar","objetivo":"O1","dificuldade":"media"}
Complete a síntese do capítulo: uma [função de perda](../glossario.md#termos-fundamentais) é um ______ de arbitragem, e não uma descoberta sobre o mundo.

> **volte para:** #sintese-o-que-levar
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::cartao {"nivel":8,"titulo":"Verificação"}

## Verificação

1. Mostre, sem consultar o texto, por que a reta de [mínimos quadrados](../glossario.md#regressao-linear) passa necessariamente pelo ponto $(\bar{x}, \bar{y})$.
2. Você tem 180 linhas e 60 [atributos](../glossario.md#termos-fundamentais). Que família de modelo você tenta primeiro, e por quê?
3. Dois atributos do seu modelo são quase idênticos. O erro de validação está ótimo. O que pode estar errado mesmo assim?
4. No laboratório, o que aconteceria com a reta ótima se todos os pontos tivessem o mesmo $x$? Responda pela fórmula, não pelo desenho.

:::interacao {"id":"modelos-lineares-i37","tipo":"principio","titulo":"A primeira, de cabeça"}
Responda a questão 1 antes de revelar, com as suas palavras.

> **pergunta:** Por que a reta ótima passa por $(\bar{x}, \bar{y})$?
> **revela:** No mínimo, a derivada da perda em relação a $b$ se anula, e isso equivale a dizer que a soma dos resíduos é zero. Dividindo por $n$, a média dos resíduos é zero, o que dá $\bar{y} - a\bar{x} - b = 0$. Logo o ponto $(\bar{x}, \bar{y})$ satisfaz a equação da reta.
>
> Compare com o que você escreveu. Se o seu argumento partiu do desenho, ou de "faz sentido que passe pelo meio", ele não é uma demonstração: o que fecha a questão é a condição de primeira ordem, e nada além dela.
:::

:::exercicio {"id":"modelos-lineares-e40","tipo":"numerica","objetivo":"O3","dificuldade":"dificil"}
Questão 3, na célula 8.1 do [notebook](https://github.com/GHDaru/machinelearning/blob/main/ml-zero/etapa-05/regressao_limonada.ipynb). Troque `arredondar` para `True` e rode: entra uma cópia da `temperatura`, arredondada ao grau. Responda o [coeficiente](../glossario.md#diagnostico-e-leitura-do-modelo) de `temperatura`, com quatro casas.

> **volte para:** #verificacao
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"modelos-lineares-e50","tipo":"numerica","objetivo":"O2","dificuldade":"dificil"}
Questão 4, na célula 8.2 do mesmo notebook. Ponha `mes = 7` e rode: sai o $S_{xx}$ de cada coluna em julho. Responda o da `temperatura`, arredondado à unidade.

> **volte para:** #verificacao
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::
