Soluções — Regressão Linear e Máxima Verossimilhança
Aula 5 — Por Que Mínimos Quadrados É Máxima Verossimilhança Sob Ruído Gaussiano
Dica(Resposta) Teste 1 — Geometria da Projeção e Resíduos
- ✔ Verdadeiro — A projeção ortogonal de um vetor sobre um subespaço que já o contém é o próprio vetor — não há “sobra” fora do subespaço para descartar, então o resíduo é nulo.
- ✔ Verdadeiro — \(N\) colunas linearmente independentes em \(\mathbb R^N\) geram o espaço inteiro; a projeção de qualquer \(y\in\mathbb R^N\) sobre \(\mathbb R^N\) é o próprio \(y\) — é o caso degenerado de interpolação perfeita (zero graus de liberdade sobrando).
- ✗ Falso — Ter “pelo menos dois” perfis não garante que o vetor de avaliações esteja dentro do subespaço que eles geram — erro zero só ocorre se o vetor alvo pertencer exatamente a esse subespaço, o que depende da dimensão do subespaço relativa à dimensão do problema, não de uma contagem mínima arbitrária de perfis.
- ✗ Falso — Ortogonalidade às colunas de \(X\) garante ortogonalidade a todo o subespaço \(\mathcal S\) que elas geram (por linearidade) — mas nada garante ortogonalidade a um vetor arbitrário fora de \(\mathcal S\), que pode ter componentes em qualquer direção.
Dica(Resposta) Teste 2 — RSS, Equações Normais e Posto de X
- ✔ Verdadeiro — Reescalar uma coluna por \(c\) e dividir o coeficiente correspondente por \(c\) deixa o produto \(X\beta\) inalterado — a reta ajustada e a soma de quadrados mínima não dependem da escala escolhida para os atributos.
- ✔ Verdadeiro — Com \(X\) sendo um vetor de uns, a equação normal vira \(\mathbf 1^T(y-\hat\beta_0\mathbf 1)=0\), ou seja, \(\sum(y_n-\hat\beta_0)=0\), cuja solução é exatamente \(\hat\beta_0=\bar y\).
- ✗ Falso — A equação normal de fato não depende de qual atributo do dataset é usado como preditor — mas extrapolar para fora do intervalo onde os dados de treino existiram nunca tem a mesma confiabilidade estatística que interpolar dentro dele; não há garantia de que a relação linear observada continue válida fora da faixa observada.
- ✗ Falso — \(\text{RSS}(\beta)\) é sempre convexa, mas só é estritamente convexa quando \(X^TX\) é não-singular (posto completo). Quando \(X^TX\) é singular, existe um subespaço inteiro de vetores \(\beta\) que atingem o mesmo valor mínimo de RSS — o mínimo deixa de ser único, mesmo continuando global.
Dica(Resposta) Teste 3 — Premissas do Modelo Gaussiano Homocedástico
- ✔ Verdadeiro — A fatoração da densidade conjunta como produto de densidades individuais é consequência direta da suposição de independência — sem ela, a densidade conjunta exigiria modelar a estrutura de correlação entre observações, não apenas suas marginais.
- ✔ Verdadeiro — Com \(\sigma^2\to\infty\), a distribuição condicional de \(Y\) dado \(X\) se torna cada vez mais dispersa em torno da média correta \(\beta^TX\) — o valor médio previsto continua certo, mas a incerteza em torno dele domina completamente qualquer previsão individual útil.
- ✗ Falso — A primeira parte é razoável (homocedasticidade é uma suposição plausível quando a variabilidade não depende sistematicamente da variável explicativa), mas a segunda não: o ajuste por mínimos quadrados não verifica homocedasticidade — ele simplesmente minimiza RSS independentemente de a suposição valer ou não. Confirmar (ou refutar) homocedasticidade exige inspecionar os resíduos depois do ajuste (como o próprio bloco de “Limitações” faz ao encontrar heterocedasticidade real no ajuste de preços de imóveis), nunca é uma garantia automática do procedimento de ajuste.
- ✗ Falso — O modelo só faz uma suposição sobre a distribuição condicional de \(Y\) dado \(X\). A distribuição marginal de \(Y\) depende também de como \(X\) está distribuído na população, e em geral não é gaussiana (é uma mistura de gaussianas ponderada pela distribuição de \(X\)) — a suposição do modelo não exige nada sobre essa marginal.
Dica(Resposta) Teste 4 — Construção da Verossimilhança Conjunta
- ✔ Verdadeiro — Uma função estritamente crescente preserva a localização do máximo — maximizar \(f(\beta)\) ou \(\ln f(\beta)\) (com \(f>0\)) sempre produz o mesmo \(\hat\beta\). O log só é usado por conveniência algébrica (transforma produto em soma), não porque muda o resultado.
- ✔ Verdadeiro — Com um único ponto e dois ou mais parâmetros livres (\(\beta_0,\beta_1,\ldots\)), existe uma família inteira de retas com RSS\(=0\) passando exatamente por esse ponto — todas maximizam igualmente a log-verossimilhança, sem um único ótimo.
- ✗ Falso — A parte sobre multiplicar densidades e logaritmar é válida para qualquer família de distribuições — mas comparar valores brutos de log-verossimilhança máxima entre famílias distribucionais diferentes (gaussiana vs. exponencial) não é uma comparação válida sem correção; são escalas e normalizações distintas, não diretamente comparáveis pelo valor numérico bruto.
- ✗ Falso — É exatamente o oposto: para qualquer \(\sigma^2>0\) fixo, maximizar \(\ell\) em relação a \(\beta\) equivale a minimizar \(\text{RSS}(\beta)\) (o termo \(1/2\sigma^2\) é apenas um fator multiplicativo positivo que não muda onde está o mínimo) — dando \(\hat\beta_{\text{OLS}}\) independentemente de \(\sigma^2\). Só depois, com \(\hat\beta\) fixo, maximiza-se em relação a \(\sigma^2\). A sequência funciona perfeitamente bem.
Dica(Resposta) Teste 5 — O Teorema Central: OLS = MLE
- ✔ Verdadeiro — Para qualquer \(\sigma^2>0\) fixo, o único termo de \(\ell\) que depende de \(\beta\) é \(-\text{RSS}(\beta)/(2\sigma^2)\) — maximizar isso em relação a \(\beta\) equivale a minimizar \(\text{RSS}(\beta)\), independentemente do valor específico de \(\sigma^2\).
- ✔ Verdadeiro — Com \(\text{RSS}=0\), \(\ell=-\frac N2\ln(2\pi)-N\ln\sigma\); conforme \(\sigma\to0^+\), \(\ln\sigma\to-\infty\), então \(-N\ln\sigma\to+\infty\) — a log-verossimilhança diverge, um sintoma conhecido de degenerescência do ajuste perfeito no modelo gaussiano.
- ✔ Verdadeiro — É o mesmo mecanismo do teorema central desta aula rodado ao contrário: a forma exponencial-quadrática \(\exp\{-(\cdot)^2/2\sigma^2\}\) é o que torna a log-verossimilhança gaussiana literalmente uma soma de quadrados com sinal trocado. Outras densidades comuns (Laplace, por exemplo) produzem outros termos (valor absoluto) — só a gaussiana produz especificamente o termo quadrático que colapsa em minimizar RSS.
- ✗ Falso — A equivalência é específica do ruído gaussiano aditivo em regressão linear — sob outra suposição de ruído (Laplace) ou outro tipo de modelo (regressão logística, por exemplo, com alvo binário), a máxima verossimilhança leva a minimizar uma função de erro diferente, não a soma de quadrados.
Dica(Resposta) Teste 6 — Viés do MLE de \(\sigma^2\)
- ✔ Verdadeiro — É o estimador não-viesado clássico de \(\sigma^2\) em regressão linear — corrige exatamente o viés introduzido por estimar \(\beta\) a partir dos mesmos dados usados para medir a dispersão residual, mas o estimador de máxima verossimilhança é, por definição, \(\text{RSS}/N\), não essa versão corrigida.
- ✔ Verdadeiro — A razão entre os dois estimadores é exatamente \(N/(N-2)\) — conforme \(N\) cresce com o número de parâmetros fixo, essa razão converge a \(1\), e o viés relativo desaparece assintoticamente.
- ✗ Falso — A primeira parte (o padrão de viés é geral) é correta — é o mesmo fenômeno já visto para a variância gaussiana em problemas de estimação de densidade. Mas a conclusão de que o estimador não-viesado é “sempre preferível… sem exceção” é um exagero: viés não é o único critério de qualidade de um estimador (ver item seguinte, sobre erro quadrático médio).
- ✗ Falso — Viés é só um dos componentes do erro quadrático médio (MSE = viés² + variância). Um estimador viesado pode ter variância menor o bastante para ter MSE menor que a versão não-viesada — “viesado” não implica “pior em qualquer critério”, é uma generalização indevida do fato do viés isoladamente.
Dica(Resposta) Teste 7 — Verificação Numérica e Otimização
- ✔ Verdadeiro — Para \(\sigma\) fixo, \(\ell(\beta)\) é uma parábola invertida (côncava) em \(\beta\) — tem um único máximo global, sem máximos locais escondidos onde um otimizador possa ficar preso, independentemente de onde a busca comece.
- ✗ Falso — A primeira parte é correta (grades grosseiras introduzem erro de discretização), mas a conclusão é um exagero: um grid search continua tendo valor real de verificação/pedagógico (mostrar visualmente que a superfície tem um único pico exatamente onde a forma fechada aponta) mesmo quando uma forma fechada já está disponível.
- ✔ Verdadeiro — O princípio (comparar um resultado analítico contra uma busca numérica independente) continua logicamente válido em qualquer dimensão; o que muda é a viabilidade computacional de visualizar/varrer uma superfície com milhões de dimensões, uma limitação prática, não conceitual.
- ✗ Falso — A confirmação numérica vale para um dataset específico e um otimizador que convergiu corretamente — é uma ilustração empírica, não uma prova geral. A prova matemática de que a equivalência vale para qualquer conjunto de dados é a derivação algébrica do teorema central, não a checagem numérica.
Dica(Resposta) Teste 8 — Limitações: Heterocedasticidade, Censura e Não-Linearidade
- ✔ Verdadeiro — Como a censura afeta principalmente a cauda de renda alta, “destelhar” esses valores mudaria justamente a relação entre
MedIncalto eMedHouseVal, a região que mais influencia a inclinação estimada. - ✔ Verdadeiro — Se \(y\) é constante, \(\text{Cov}(x,y)=0\) para qualquer \(x\), e \(\hat\beta_1=\text{Cov}(x,y)/\text{Var}(x)=0\) — não há variação em \(y\) para nenhum atributo explicar.
- ✗ Falso — O viés de censura é sistemático (estrutural), não um efeito de variância amostral — aumentar \(N\) reduz a incerteza em torno de uma estimativa, mas não corrige um viés que vem de ignorar uma distorção presente em cada observação censurada; o viés persiste independentemente do tamanho da amostra.
- ✗ Falso — Heterocedasticidade compromete a confiabilidade da quantificação de incerteza em torno das previsões (intervalos de confiança, testes de hipótese), não a validade do ponto central previsto — as previsões pontuais continuam informativas, só precisam ser interpretadas com o cuidado adicional de que a incerteza real varia com
MedInc.