Entre os indicadores de regressão, poucos são tão conhecidos — e tão mal interpretados — quanto o coeficiente de determinação R². A frase “o modelo explica 85%” parece intuitiva, mas pode esconder problemas de definição, seleção de modelo e uso fora do domínio dos dados.
R² é valioso quando colocado no lugar correto: uma medida de ajuste dentro da amostra. Ele não substitui diagnóstico de resíduos, conhecimento do processo, validação preditiva nem desenho causal.
Da soma de quadrados ao R²
Em regressão com intercepto, podemos decompor a variação observada de Y em uma parcela associada ao modelo e uma parcela residual. A soma de quadrados total (SST ou STQ) mede a variação de Y em torno de sua média. A soma de quadrados do erro (SSE ou SEQ) mede a variação que permanece entre os valores observados e os valores ajustados.
Se SSE é muito menor que SST, o modelo reduz bastante o erro em relação a simplesmente usar a média de Y.
R²=0,80 significa, no contexto do modelo e da amostra, que 80% da variabilidade de Y em torno da média é associada às variações capturadas pela função ajustada. Não significa que “80% de Y é causado por X”.
Por que um R² alto pode enganar
- Tendência comum: duas séries podem crescer ao longo do tempo e produzir alto R² sem relação causal direta.
- Outliers: poucos pontos influentes podem aumentar ou reduzir substancialmente o ajuste.
- Faixa estreita: a qualidade do ajuste depende da região observada de X.
- Modelo errado: um padrão não linear pode produzir R² aparentemente aceitável, mas resíduos sistemáticos.
- Sobreajuste: adicionar termos aumenta a flexibilidade e tende a elevar R² dentro da amostra.
Por que existe o R² ajustado
O R² comum nunca diminui quando novas preditoras são incluídas: no pior caso, o modelo pode atribuir coeficiente próximo de zero à variável adicional. Isso cria incentivo para modelos cada vez maiores, mesmo quando os termos extras acrescentam pouco conhecimento.
O R² ajustado penaliza a complexidade ao considerar o número de coeficientes e os graus de liberdade. Uma forma usual é:
n é o número de observações e p é o número de parâmetros estimados, incluindo o intercepto.
Se um novo termo não reduzir SSE o suficiente para compensar a perda de graus de liberdade, R² ajustado pode diminuir. Por isso ele é mais informativo do que R² para comparar modelos com complexidades diferentes — embora também não substitua validação.
Exemplo: quando uma variável “melhora” R² e piora a ciência
| Modelo | Preditores | R² | R² ajustado | Leitura |
|---|---|---|---|---|
| A | Temperatura | 0,71 | 0,70 | Modelo simples. |
| B | Temperatura + umidade | 0,78 | 0,76 | Ganho consistente. |
| C | + 8 variáveis pouco relacionadas | 0,82 | 0,69 | R² sobe; penalização revela complexidade fraca. |
Os números são ilustrativos. O ponto metodológico é que melhor ajuste aparente não é automaticamente melhor modelo.
R² também é uma estimativa e varia com a amostra
O white paper de regressão simples do Assistente do Minitab demonstra por simulação que R² ajustado pode variar consideravelmente em amostras pequenas. No estudo apresentado, 40 observações foram adotadas como referência operacional para obter maior estabilidade da estimativa: em suas condições simuladas, havia 90% de chance de o R² ajustado observado ficar dentro de 0,20 do valor populacional.
Esse resultado pertence ao desenho e aos modelos estudados pelo Assistente. Não deve ser convertido em regra universal de “40 pontos para toda regressão”. O princípio geral é mais importante: R² possui incerteza amostral.
R² alto não garante boa previsão
Um modelo pode ajustar muito bem os dados usados na construção e falhar em novos dados. Isso acontece quando captura ruído específico da amostra, quando o processo muda ou quando a previsão é realizada fora da região observada.
Se o objetivo é prever, métricas fora da amostra — erro absoluto médio, RMSE, validação cruzada, conjunto de teste — tornam-se centrais. R² dentro da amostra é apenas uma parte da avaliação.
R² baixo pode ser útil
Em sistemas humanos, biológicos, financeiros ou de campo, grande parte da variabilidade pode depender de fatores não observados. Um R² de 0,25 pode ainda representar uma relação real e útil se o efeito for consistente, operacionalmente relevante e parte de uma decisão robusta.
Da mesma forma, processos de controle muito precisos podem exigir R² alto para previsão confiável. Não existe um número mágico que separa “bom” de “ruim” em todos os domínios.
R² não mede causalidade
Um modelo pode ter R²=0,95 porque X e Y respondem à mesma terceira variável. Para afirmar efeito causal, são necessários argumentos de desenho: temporalidade, controle de confundidores, experimento ou quase-experimento, mecanismo plausível e robustez.
Em DMAIC, um R² elevado pode priorizar uma causa potencial em Analyze. A confirmação pode exigir estratificação adicional ou teste PDSA/DOE em Improve.
Quando comparar R² e quando não comparar
Comparar R² entre modelos pode fazer sentido quando eles usam a mesma resposta, a mesma base e estruturas compatíveis. Comparações entre respostas com transformações distintas, amostras diferentes ou métricas de erro diferentes podem ser enganosas. Em regressões sem intercepto, inclusive, a interpretação usual de R² muda.
Sequência Struckel para avaliar ajuste
- Faça o gráfico de dispersão.
- Defina a forma funcional a partir do processo, não apenas do software.
- Verifique R² e R² ajustado.
- Examine magnitude e sinais dos coeficientes.
- Analise resíduos e influência.
- Questione se a amostra cobre a região de decisão.
- Se previsão for objetivo, valide fora da amostra.
- Se causalidade for objetivo, trate regressão como evidência, não como prova isolada.
Nota metodológica
A definição e o comportamento de R² e R² ajustado seguem a teoria clássica de modelos lineares. A discussão sobre estabilidade amostral utiliza os resultados específicos do white paper técnico do Assistente do Minitab analisado pela Struckel, mantendo a distinção entre evidência de um estudo e regra geral.
Ferramenta ajuda a executar. Método ajuda a transformar.
Se o desafio deixou de ser apenas entender um conceito e passou a envolver processo, indicadores, variabilidade, governança ou projeto de melhoria, a Struckel pode estruturar a jornada com sua equipe.