# II.3 — Regressão Logística

> **Estado da arte capturado em 2026-08** · última revisão 2026-08-11 · [histórico](../HISTORICO.md)
>
> **Nível: essencial.** Corpo escrito e prática funcionando; o aprofundamento (experimento próprio, todas as fontes conferidas, cláusula de expiração) vem em ciclo próprio — ver [níveis de maturidade](../GUIA-EDITORIAL.md#niveis-de-maturidade).

## Objetivos de aprendizagem

- **O1.** Explicar por que a regressão logística é um modelo de classificação apesar do nome.
- **O2.** Interpretar um coeficiente como efeito sobre a **razão de chances**, e não sobre a probabilidade.
- **O3.** Justificar por que a perda é a entropia cruzada e por que não há solução fechada.

> Este capítulo saiu do [II.2 — Modelos Lineares](ii-2-modelos-lineares.md), onde dividia espaço com a regressão linear. Compartilham a forma $w \cdot x + b$ e quase nada além disso.

## O problema: o classificador que finge ser regressão

Você quer prever se o cliente vai pagar: sim ou não. Tem os atributos, tem os rótulos 0 e 1, e tem uma regressão linear que já funciona. A tentação é imediata — ajuste a reta contra o rótulo e chame de classificador.

O resultado é ruim de um jeito específico. A reta prevê **1,7** para um cliente e **−0,4** para outro. Não são probabilidades, e nenhum arredondamento conserta: o problema não é o valor, é que a reta **não tem teto nem piso**, e a resposta que você quer tem os dois.

Pior: a perda quadrática pune o modelo por acertar com folga. Um cliente claramente bom, previsto em 1,5 quando o rótulo é 1, gera erro — e o ajuste puxa a reta para trás por causa de um caso que ele já resolveu.

O conserto não é limitar a saída na marra. É **mudar o que se modela**.

## De onde isto veio

**O aperto.** Meados do século XX, epidemiologia e bioensaio. A pergunta prática: dada uma dose, qual a **probabilidade** de o organismo responder? Havia método consolidado, o *probit*, baseado na normal acumulada, e ele funcionava. Só que exigia tabelas, iteração pesada para a época, e entregava um coeficiente que **ninguém conseguia explicar** a um médico.

**O que se fazia antes.** Ajustava-se o probit e reportava-se o resultado na escala da normal. A pergunta "quanto muda o risco se a dose dobrar?" não tinha resposta em linguagem clínica. Alternativamente, ignorava-se tudo e ajustava-se uma reta na proporção observada — com o defeito de prever probabilidades negativas nas doses baixas.

**A virada.** Modelar não a probabilidade, mas o **logaritmo da razão de chances**:

$$\log\frac{p}{1-p} = w \cdot x + b$$

O lado esquerdo varre a reta inteira, de $-\infty$ a $+\infty$; o direito é linear. O teto e o piso deixam de ser uma restrição a impor e passam a ser **consequência da forma escolhida**.

**A ideia reaproveitável.** **Quando a saída tem fronteiras e o modelo não, transforme a saída — não restrinja o modelo.** É o mesmo movimento que aparece no logaritmo de valores positivos, no *softmax* de várias classes e na função de ligação de qualquer modelo linear generalizado. A restrição vira mudança de escala, e o maquinário linear continua valendo inteiro.

**O nome.** *Logit*, contração de *logistic unit* (em português, **logito**), foi cunhado por **Joseph Berkson** em 1944. A história de referência sobre a origem do modelo é direta quanto ao gesto: ele *"proposed the use of the logistic, coining the term 'logit' by analogy to the 'probit' of Bliss (for which he was initially much derided)"*. O nome era um eco proposital do concorrente, e Berkson foi bastante ridicularizado por isso no começo.

A polêmica que se seguiu não foi só entre as duas escalas, e essa parte costuma sumir no resumo. Nas palavras da mesma fonte, *"the issue of logit versus probit was tangled by Berkson's simultaneous attacks on the method of maximum likelihood and his advocacy of minimum chi-squared estimation instead"*. Ou seja: a briga do logito contra o probito veio embrulhada numa segunda briga, sobre como estimar, e chegou ao ponto de trocas ácidas entre Berkson e R. A. Fisher.

Vale registrar a ironia, porque ela é o padrão que este livro persegue: **o próprio probito tem paternidade disputada.** A invenção é usualmente creditada a Gaddum (1933) e Bliss (1934), e a mesma fonte adverte que isso *"is too simple"*, com raízes que recuam até Fechner, no século XIX.

A palavra *logística* vem antes de tudo isso, da curva de Pierre François Verhulst (1838), estudando crescimento populacional limitado. É a mesma curva em S, chegando aqui por outro caminho.

**Procedência das afirmações desta seção:**

| Selo | Afirmação |
|---|---|
| ✓ᵐ | Berkson, "Application of the Logistic Function to Bio-Assay", *Journal of the American Statistical Association*, 1944 — obra, ano e o fato de cunhar *logit*. [DOI 10.1080/01621459.1944.10500699](https://doi.org/10.1080/01621459.1944.10500699). **Não lida** |
| ✓ᵐ | Verhulst (1838), "Notice sur la loi que la population suit dans son accroissement" — a curva logística e o nome. **Não lida** |
| ✓ᵐ | Cox, "The Regression Analysis of Binary Sequences", *Journal of the Royal Statistical Society B*, 1958 — o trabalho que consolida o modelo na forma usada hoje. [DOI 10.1111/j.2517-6161.1958.tb00292.x](https://doi.org/10.1111/j.2517-6161.1958.tb00292.x). **Não lida** |
| ✓ | O gesto de Berkson em 1944 e os trechos citados entre aspas, mais a paternidade disputada do próprio probito e o embrulho com a disputa sobre máxima verossimilhança, em [J. S. Cramer, *"The Origins of Logistic Regression"*](https://papers.tinbergen.nl/02119.pdf) (Tinbergen Institute, TI 2002-119/4), **lido** |
| ✓ | Que a **facilidade de cálculo** pesou a favor do logito: a mesma fonte diz que *"in the practical aspect of ease of computation the logit had a clear advantage over the probit"*, e cita Cochran sobre a adoção de um método depender da simplicidade das contas |
| ⏳ | Que a motivação incluísse **interpretabilidade clínica**. A vantagem de cálculo está conferida; a de explicar o coeficiente a um médico é a leitura corrente, e não a encontrei afirmada na fonte lida |
| ❌ | A data em que o método passou a ser padrão em crédito e seguro — procurei e não achei fonte com data defensável |
| 📖 | A ideia reaproveitável ("transforme a saída, não restrinja o modelo") e a ligação com o *softmax* |

> **Dívida declarada.** As três fontes acima estão seladas **✓ᵐ**: sei que existem, com DOI conferido, e não as li. O que este capítulo afirma sobre o que elas argumentam por dentro está, portanto, apoiado em leitura secundária. É a dívida **D10** do roadmap, e se paga lendo, não suavizando o texto.

## Fundamentos: a sigmoide e o logito

Invertendo a equação da virada, chega-se à forma que se usa para prever:

$$p = \sigma(z) = \frac{1}{1 + e^{-z}}, \qquad z = w \cdot x + b$$

A **sigmoide** comprime a reta inteira em $[0, 1]$: manda $-\infty$ para 0, $0$ para $0{,}5$ e $+\infty$ para 1.

O ponto que dá nome ao modelo é a volta:

$$z = \log\frac{p}{1-p}$$

O que é linear nos atributos **não é a probabilidade** — é o **logito**, o logaritmo da razão de chances. A regressão logística é uma regressão linear *sobre o logito*, usada para classificar.

:::exercicio {"id":"regressao-logistica-e1","tipo":"multipla","objetivo":"O1","dificuldade":"facil"}
Numa regressão logística, o que é linear nos atributos?

- [ ] A probabilidade prevista.
- [ ] O logito — o logaritmo da razão de chances.
- [ ] A classe prevista (0 ou 1).
- [ ] O erro de classificação.

> **volte para:** #fundamentos-a-sigmoide-e-o-logito
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"regressao-logistica-e4","tipo":"numerica","objetivo":"O1","dificuldade":"media"}
Um modelo de regressão logística calcula $z = w \cdot x + b = 0$ para um determinado cliente.

Qual probabilidade a sigmoide devolve? Responda com duas casas decimais.

> **volte para:** #fundamentos-a-sigmoide-e-o-logito
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"regressao-logistica-e5","tipo":"multipla","objetivo":"O1","dificuldade":"dificil"}
Um analista escreve no relatório: "cada ano a mais de relacionamento aumenta a probabilidade de renovação em 4 pontos percentuais, segundo o coeficiente do modelo". Qual é o problema da frase?

- [ ] Nenhum, desde que o coeficiente tenha sido convertido corretamente.
- [ ] O efeito constante é sobre o logito, e o efeito em pontos percentuais depende de onde o cliente estava: perto de 0,5 o deslocamento é grande, perto de 0 ou de 1 é quase nulo.
- [ ] O erro é usar pontos percentuais em vez de porcentagem relativa.
- [ ] O erro é que o coeficiente mede correlação, e correlação não se reporta a clientes.

> **volte para:** #fundamentos-a-sigmoide-e-o-logito
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

## Por que a perda muda, e por que a solução fechada some

O [capítulo II.2](ii-2-modelos-lineares.md#a-deducao-em-cinco-passos) deduziu a reta ótima em cinco passos, e o quarto entregou uma fórmula. Aqui o mesmo caminho **não chega ao fim** — e vale entender onde ele para.

**Primeiro, a perda.** Usar erro quadrático sobre a saída da sigmoide dá uma superfície **não convexa**: aparecem mínimos locais, e o otimizador pode parar num deles. A perda usada é a **entropia cruzada** (ou *log-loss*):

$$L = -\frac{1}{n}\sum_{i=1}^{n}\left[y_i \log p_i + (1 - y_i)\log(1 - p_i)\right]$$

Ela é convexa em $w$, e tem uma leitura direta: pune **muito** a previsão confiante e errada. Prever 0,99 para quem era 0 custa $\log(0{,}01)$ — um número grande. Prever 0,5 custa pouco em comparação. O modelo aprende a ter medo de errar com convicção, que é exatamente o comportamento que se quer de uma probabilidade que vai virar decisão.

**Segundo, o que some.** Derivando a entropia cruzada e igualando a zero, chega-se a

$$\sum_{i=1}^{n}\left(\sigma(w \cdot x_i + b) - y_i\right)x_i = 0$$

que tem a **mesma forma** da condição do capítulo II.2 — resíduo ortogonal ao atributo. Só que aqui o "resíduo" contém $\sigma(\cdot)$, e $w$ está **dentro** de uma função não linear. Não há como isolar $w$: o sistema é transcendental.

É por isso que a logística **não tem** equações normais, e o gradiente deixa de ser uma alternativa elegante para virar a única saída. A frase do capítulo II.2, *"o gradiente é a ferramenta geral; a solução fechada é o caso de sorte"*, recebe aqui a sua demonstração.

:::lab {"id":"regressao-logistica-l1","tipo":"anima-separavel","titulo":"A perda ainda cai. O modelo ainda melhora?"}
Duzentos pontos, duas classes, linearmente separáveis por uma folga estreita. Descida de gradiente na entropia cruzada, 400 passos. Três números no placar: a **norma de w**, a perda e a acurácia.

No passo 52 a acurácia chega a 1,000 e não sai mais de lá. Todos os pontos do lado certo, todos.

**Aqui vem a pergunta que a animação existe para fazer.** Do passo 52 ao 400 a perda continua caindo, de 0,23 para 0,078. O modelo continua melhorando?

**Não.** A fronteira é a mesma; o que muda é a confiança. A norma de w vai de 6,08 no passo 200 para 7,91 no passo 400, e continuaria subindo se a animação não parasse. Com dado separável, o máximo da verossimilhança **não existe em ponto nenhum**: a perda tende a zero à medida que a norma tende ao infinito, empurrando as probabilidades para 0 e para 1. Não é o otimizador que está mal ajustado, é que não há ponto ótimo a alcançar. E "não há solução fechada" quer dizer exatamente isto quando se olha de perto.

**Clique em "E se houvesse penalização L2?".** A norma para em 3,31 e fica lá, a perda estabiliza em 0,226, e a acurácia continua 1,000. A penalização não melhorou a classificação: ela **devolveu ao problema um ponto ótimo que ele não tinha**. É por isso que regularizar não é ajuste fino.
:::

:::exercicio {"id":"regressao-logistica-e3","tipo":"multipla","objetivo":"O3","dificuldade":"media"}
Por que a regressão logística não tem solução fechada, como a linear tem?

- [ ] Porque a entropia cruzada não é diferenciável.
- [ ] Porque o problema não é convexo, e por isso não há mínimo único.
- [ ] Porque, ao anular a derivada, os pesos ficam presos dentro da sigmoide — e o sistema resultante não é linear nos pesos.
- [ ] Porque a solução fechada exigiria inverter uma matriz singular.

> **volte para:** #por-que-a-perda-muda-e-por-que-a-solucao-fechada-some
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"regressao-logistica-e6","tipo":"multipla","objetivo":"O3","dificuldade":"facil"}
Por que a regressão logística usa entropia cruzada em vez de erro quadrático?

- [ ] Porque o erro quadrático não pode ser calculado sobre probabilidades.
- [ ] Porque o erro quadrático sobre a saída da sigmoide dá uma superfície não convexa, com mínimos locais em que o otimizador pode parar.
- [ ] Porque a entropia cruzada tem solução fechada e o erro quadrático não.
- [ ] Porque a entropia cruzada é mais rápida de calcular.

> **volte para:** #por-que-a-perda-muda-e-por-que-a-solucao-fechada-some
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"regressao-logistica-e7","tipo":"multipla-multi","objetivo":"O3","dificuldade":"dificil"}
Sobre a entropia cruzada e a condição de otimalidade da logística, quais afirmações são corretas? (marque todas que valem)

- [ ] A condição tem a mesma forma da linear: o resíduo fica ortogonal ao atributo.
- [ ] O que impede isolar $w$ é ele estar dentro da sigmoide, o que torna o sistema transcendental.
- [ ] Prever 0,99 para um exemplo de classe 0 custa muito mais que prever 0,5.
- [ ] Como não há solução fechada, o problema pode ter vários mínimos e o resultado depende da inicialização.

> **volte para:** #por-que-a-perda-muda-e-por-que-a-solucao-fechada-some
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

## Interpretar o coeficiente: chance, não probabilidade

Uma definição antes da leitura, porque a palavra trabalha contra o capítulo. A **chance** (*odds*) de um evento é a razão entre a probabilidade de ele ocorrer e a de não ocorrer, $p/(1-p)$: probabilidade 0,5 é chance 1 — "um para um"; probabilidade 0,9 é chance 9. **No português do dia a dia, "chance" é sinônimo de probabilidade. Aqui não é, e essa é justamente a distinção que o capítulo existe para ensinar.** A **razão de chances** é o quociente entre duas chances.

Aumentar $x_j$ em uma unidade **multiplica a chance** por $e^{w_j}$ — ou seja, produz uma razão de chances de $e^{w_j}$.

Um coeficiente de 0,7 significa chance multiplicada por $e^{0{,}7} \approx 2$ — **a chance dobra**. Não a probabilidade: a chance.

A diferença é grande e é onde os relatórios erram:

| Probabilidade antes | Chance antes | Chance depois (× 2) | Probabilidade depois |
|---|---|---|---|
| 0,10 | 0,11 | 0,22 | **0,18** |
| 0,50 | 1,00 | 2,00 | **0,67** |
| 0,90 | 9,00 | 18,00 | **0,95** |

O mesmo coeficiente move a probabilidade em 8, 17 e 5 pontos percentuais, dependendo de onde se estava. Por isso "este atributo aumenta o risco em X pontos" é uma frase sem sentido fora de um ponto específico.

E tudo o que o [capítulo II.2](ii-2-modelos-lineares.md#as-quatro-coisas-que-ele-nao-diz) diz sobre o que o coeficiente **não** significa continua valendo aqui, palavra por palavra: não é causa, não é comparável sem padronização, não é estável sob colinearidade e não vale fora da faixa observada.

:::exercicio {"id":"regressao-logistica-e2","tipo":"multipla-multi","objetivo":"O2","dificuldade":"dificil"}
Um modelo de risco de crédito, com atributos padronizados, tem coeficiente 0,7 para `dívida_atual`. Quais leituras são **corretas**? (marque todas que valem)

- [ ] Um desvio-padrão a mais de dívida multiplica a razão de chances de inadimplência por aproximadamente 2.
- [ ] Um desvio-padrão a mais de dívida aumenta a probabilidade de inadimplência em 70 pontos percentuais.
- [ ] Reduzir a dívida do cliente reduziria o risco dele na proporção do coeficiente.
- [ ] Se `dívida_atual` for muito correlacionada com `renda_comprometida`, este coeficiente pode ser instável entre reamostragens.
- [ ] Como o coeficiente é o maior do modelo, dívida é a causa principal da inadimplência.

> **volte para:** #interpretar-o-coeficiente-chance-nao-probabilidade
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"regressao-logistica-e8","tipo":"numerica","objetivo":"O2","dificuldade":"facil"}
A probabilidade de um evento é 0,80. Qual é a **chance** (*odds*) dele?

> **volte para:** #interpretar-o-coeficiente-chance-nao-probabilidade
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

:::exercicio {"id":"regressao-logistica-e9","tipo":"multipla","objetivo":"O2","dificuldade":"media"}
Um coeficiente vale 0,7, e portanto multiplica a chance por aproximadamente 2. Dois clientes recebem o mesmo aumento de um desvio-padrão nesse atributo: um estava com probabilidade 0,10 e o outro com 0,90. O que acontece com cada um?

- [ ] Os dois sobem 20 pontos percentuais, porque o efeito do coeficiente é o mesmo.
- [ ] O primeiro vai a 0,18 e o segundo a 0,95: mesmo efeito sobre a chance, efeitos muito diferentes sobre a probabilidade.
- [ ] O primeiro vai a 0,20 e o segundo a 1,80, que é impossível e mostra que o modelo falhou.
- [ ] Nada muda para o segundo, porque a probabilidade já está saturada.

> **volte para:** #interpretar-o-coeficiente-chance-nao-probabilidade
> _Gabarito, explicação e rubrica não vão neste arquivo. Quem corrige é o servidor, e a explicação completa é o que a segunda tentativa paga._
:::

## Mão na massa

A **etapa 05–06** do [`ml-zero`](../trilha-ml-zero.md) traz `RegressaoLogistica` em biblioteca padrão, com regularização L1 e L2 e leitura por `razao_de_chances()`. O otimizador é o mesmo da linear — só a função de perda muda, que é o ponto da arquitetura do [capítulo II.4](ii-4-otimizacao.md).

**Notebook** — [`regressao_limonada.ipynb`](https://github.com/GHDaru/machinelearning/blob/main/ml-zero/etapa-05/regressao_limonada.ipynb) cobre a linear. Um notebook próprio para a logística está na fila; enquanto isso, o caminho é importar `RegressaoLogistica` da mesma etapa e ajustar contra um rótulo binário.

## Assista

:::video {"id":"regressao-logistica-v1","fonte":"youtube","ref":"yIYKR4sgzI8","min":9,"autor":"StatQuest with Josh Starmer","titulo":"StatQuest: Logistic Regression"}
O que o texto explica algebricamente (a sigmoide comprimindo a reta, o logito voltando a ser linear) o vídeo mostra **geometricamente**, com a curva em S sendo ajustada aos pontos. Se a frase "o que é linear é o logito, não a probabilidade" ainda parece um detalhe técnico, este é o material que a transforma em imagem. Assista antes do exercício regressao-logistica-e2.
:::

## Síntese — o que levar

- A logística **classifica**. O nome vem de modelar o **logito** com uma regressão linear.
- Teto e piso não são impostos ao modelo: são **consequência** de transformar a saída. Quando a resposta tem fronteiras e o modelo não, mude a escala da resposta.
- A perda é **entropia cruzada**, não erro quadrático — por convexidade, e porque punir a confiança errada é o comportamento desejado.
- **Não há solução fechada**: ao anular a derivada, o peso fica preso dentro da sigmoide.
- O coeficiente multiplica a **razão de chances** por $e^{w}$. O efeito em pontos percentuais depende de onde se estava.

## Verificação

1. Explique por que a regressão logística tem "regressão" no nome, sem usar a palavra "sigmoide".
2. Um coeficiente vale 1,1. Um colega diz que o atributo "aumenta o risco em 110%". O que está errado na frase, e qual seria a correta?
3. Por que usar erro quadrático com a sigmoide é uma má ideia — e qual das duas razões (convexidade ou punição do erro confiante) você considera a mais grave?
4. Onde exatamente a dedução do capítulo II.2 para de funcionar aqui?
