Soluções — Independência, Naive Bayes e Teoria da Decisão
Aula 2 — Fundamentos Estatísticos do Aprendizado Supervisionado
Dica(Resposta) Teste 1 — A maldição da dimensionalidade
- ✔ Verdadeiro — Crescimento exponencial (\(M^d\)) sempre ultrapassa qualquer crescimento polinomial em \(d\) para \(d\) suficientemente grande — é um fato assintótico padrão. Nenhum orçamento de dados que cresça só polinomialmente com \(d\) acompanha o número de células.
- ✗ Falso — \(2^d\) ainda é exponencial em \(d\) — para \(d=15\), já são \(32{.}768\) células; para \(d=50\), cerca de \(10^{15}\). Reduzir \(M\) muda a base da exponencial, não elimina o expoente \(d\) que é a real fonte do problema.
- ✔ Verdadeiro — Com \(d=784\) em vez de \(d=15\), o número de células \(M^d\) é astronomicamente maior — o mesmo argumento de contagem de células, só que num domínio real e muito comum (imagens), onde a dimensionalidade típica já supera em muito o exemplo didático.
- ✗ Falso — O problema fundamental é de escassez de dados — não há dados reais suficientes para preencher \(M^d\) células de forma confiável, não importa quanto poder de processamento se tenha disponível para lidar com elas. Mais GPUs não criam mais dados.
Dica(Resposta) Teste 2 — Teoria da decisão: risco e regra de Bayes
- ✔ Verdadeiro — Sob perda 0-1, minimizar o risco posterior \(\rho(a\mid\mathbf{x})=\sum_k L(k,a)p(\mathcal{C}_k\mid\mathbf{x})\) se reduz a minimizar \(1-p(\mathcal{C}_a\mid\mathbf{x})\), que é o mesmo que maximizar \(p(\mathcal{C}_a\mid\mathbf{x})\) — exatamente a regra do posterior máximo.
- ✔ Verdadeiro — O risco posterior depende do produto entre \(L\) e a posteriori; mudar \(L\) muda esse produto e, portanto, qual ação minimiza o risco — mesmo que a posteriori em si não tenha mudado nem um pouco.
- ✔ Verdadeiro — É o mesmo deslocamento de limiar do caso binário de custo/priori (limiar \(t=c_{II}/(c_I+c_{II})\)), transferido para crédito: um custo assimétrico grande desloca o limiar de decisão para longe de \(0{,}5\), tornando a recusa a decisão ótima mesmo com alguma evidência a favor da aprovação.
- ✗ Falso — Correção da especificação do modelo não implica ausência de sobreposição entre as classes; se as densidades verdadeiras se sobrepõem, \(R^\star>0\) mesmo com o modelo perfeitamente correto — é o erro de Bayes irredutível sob perda 0-1, generalizado para perda arbitrária.
Dica(Resposta) Teste 3 — Bayes para \(K\) classes e modelos generativos
- ✗ Falso — O argumento de minimizar o erro esperado escolhendo a classe de maior conjunta nunca usou \(K=2\) como hipótese essencial — ele generaliza diretamente para \(\arg\max_k p(\mathbf{x},\mathcal{C}_k)\) com qualquer \(K\), sem precisar de reformulação.
- ✔ Verdadeiro — No processo gerativo em duas etapas, a classe é sorteada primeiro segundo \(\pi_k\); se \(\pi_k\to0\), essa classe praticamente nunca é sorteada, independentemente de como sua condicional se pareça com as demais.
- ✔ Verdadeiro — A regra da soma não é uma peculiaridade do caso binário — \(p(\mathbf{x})=\sum_{j=1}^K p(\mathbf{x},\mathcal{C}_j)\) vale para qualquer \(K\), incluindo o caso de 6 hipóteses diagnósticas.
- ✗ Falso — O conceito de modelo generativo (sortear a classe, depois os dados condicional à classe, combinar via Bayes) permanece o mesmo; trocar gaussiana por rede neural muda só a família de distribuições usada para representar \(p(\mathbf{x}\mid\mathcal{C}_k)\), não o conceito por trás da abordagem.
Dica(Resposta) Teste 4 — O modelo generativo em duas etapas
- ✔ Verdadeiro — Se todas as condicionais coincidem, saber qual classe foi sorteada na primeira etapa não afeta em nada a distribuição de onde \(\mathbf{x}\) vem na segunda etapa — a classe se torna irrelevante para o valor de \(\mathbf{x}\) observado, equivalente a amostrar sempre da mesma distribuição comum.
- ✗ Falso — Um modelo puramente discriminativo nunca estima \(p(\mathbf{x}\mid\mathcal{C}_k)\) nem \(p(\mathbf{x})\) — não há de onde amostrar novos dados sintéticos. Essa é precisamente a capacidade que se perde ao modelar só a fronteira, descartando a densidade dos dados.
- ✔ Verdadeiro — É o mesmo princípio de “IA generativa usa o mesmo conceito, muda só a família” aplicado a um exemplo concreto e atual: gerar rostos sintéticos é amostrar de um modelo ajustado a dados, o mesmo princípio do modelo em duas etapas descrito acima, só que com uma família muito mais rica.
- ✗ Falso — “Não modela \(p(\mathbf{x}\mid\mathcal{C}_k)\)” não implica “modela \(p(\mathbf{x})\)” — um modelo discriminativo tipicamente modela a posteriori \(p(\mathcal{C}_k\mid\mathbf{x})\) (ou só a fronteira) diretamente, sem nunca estimar nenhuma densidade de \(\mathbf{x}\), nem condicional nem marginal.
Dica(Resposta) Teste 5 — Generativo, discriminativo e “IA generativa”
- ✔ Verdadeiro — Se o único objetivo é a decisão (não a probabilidade em si), basta que o modelo aprenda de que lado da fronteira um ponto cai — nenhuma estimativa numericamente correta de densidade ou posteriori é estritamente necessária para isso, um caso extremo do espírito discriminativo.
- ✔ Verdadeiro — “Discriminativo” é definido justamente por não precisar modelar \(p(\mathbf{x})\); se essa estimativa se tornasse uma necessidade do procedimento, a própria definição da categoria deixaria de se aplicar — é quase uma verdade por definição, mas que testa se o conceito foi entendido com precisão.
- ✔ Verdadeiro — Gerar exemplos novos exige amostrar de uma densidade — algo que só um modelo generativo (ou um componente generativo) provê. Um discriminativo excelente em classificar não ajuda em nada nessa segunda tarefa, evidenciando a diferença prática entre os dois paradigmas.
- ✗ Falso — É o oposto do que geralmente acontece: por não precisar modelar a densidade completa de \(\mathbf{x}\) por classe, um modelo discriminativo tipicamente precisa de menos parâmetros para resolver a mesma tarefa de classificação, não mais. “Joga fora informação” não implica “precisa de mais parâmetros” — a intuição aqui está invertida.
Dica(Resposta) Teste 6 — Contraexemplos de independência: causa comum e XOR
- ✔ Verdadeiro — Se \(p(\text{grátis}\mid c)\) é a mesma para todo \(c\), então \(p(\text{grátis},\text{ganhador})=\sum_c \pi_c\, p(\text{grátis}\mid c)\,p(\text{ganhador}\mid c) = p(\text{grátis})\sum_c\pi_c\,p(\text{ganhador}\mid c)=p(\text{grátis})p(\text{ganhador})\) — a dependência marginal induzida pela causa comum desaparece exatamente quando a causa deixa de diferenciar os efeitos.
- ✗ Falso — Condicionar em \(\mathcal{C}=1\) com certeza força \(x_2=1-x_1\) (dependência perfeita); uma evidência parcial e incerta sobre \(\mathcal{C}\) induz uma dependência mais fraca entre \(x_1,x_2\), não idêntica ao caso de certeza total — o grau de dependência induzida escala com o quanto se sabe sobre a causa comum.
- ✔ Verdadeiro — É a mesma estrutura de causa comum do exemplo grátis/ganhador, transferida para métricas de e-commerce: a popularidade (análoga à classe) cria dependência marginal entre cliques e compras, mesmo que, fixado o nível de popularidade, as duas sejam condicionalmente independentes.
- ✗ Falso — O próprio exemplo de “causa comum” mostra o oposto: condicionar na classe reduz a dependência entre “grátis” e “ganhador” (de fortemente dependentes marginalmente para condicionalmente independentes). Condicionar pode criar dependência (XOR) ou removê-la (causa comum) — a direção depende da estrutura causal, não é uma regra fixa.
Dica(Resposta) Teste 7 — Independência vs. independência condicional
- ✗ Falso — É exatamente o padrão que o XOR mostrou, não o oposto: \(x_1,x_2\) são marginalmente independentes, mas condicionalmente dependentes dado \(\mathcal{C}=x_1\oplus x_2\). A afirmação descreve corretamente o exemplo, então dizer que “contradiz” é o erro.
- ✔ Verdadeiro — Se \(C\) só pode assumir um valor, condicionar em \(C\) não fornece nenhuma informação (é uma constante), então \(p(x_1,x_2\mid C)=p(x_1,x_2)\) trivialmente — as duas noções colapsam na mesma afirmação quando não há variação em \(C\) para diferenciar.
- ✔ Verdadeiro — É um fenômeno real e conhecido em genética populacional (estratificação populacional): a etnia (ou ancestralidade) funciona como causa comum, criando correlação marginal entre marcadores genéticos que são condicionalmente independentes dentro de cada subpopulação.
- ✗ Falso — É exatamente o ponto da questão discursiva 2 deste banco: a suposição pode estar fortemente violada e o classificador ainda ter boa acurácia, porque sob perda 0-1 só importa qual classe recebe o score maior, não se a posteriori estimada está numericamente correta.
Dica(Resposta) Teste 8 — O algoritmo Naive Bayes
- ✔ Verdadeiro — A soma de logs tem um termo \(\ln(0)=-\infty\); somar \(-\infty\) a qualquer conjunto de números finitos ainda resulta em \(-\infty\) — nenhuma quantidade de evidência favorável nos outros atributos compensa esse único termo.
- ✗ Falso — Ignorar o atributo remove sua contribuição por completo (equivalente a um termo neutro); suavização, em vez disso, mantém a contribuição do atributo, só deslocando a probabilidade estimada de \(0\) para um valor pequeno mas positivo — os dois efeitos matemáticos são diferentes, não duas implementações da mesma correção.
- ✔ Verdadeiro — É a mesma patologia da probabilidade zero, transferida para um cenário realista e comum de NLP: uma única palavra nunca vista numa classe zera completamente o score daquela classe para qualquer texto que a contenha.
- ✗ Falso — São dois problemas numéricos distintos: underflow vem de multiplicar muitos números pequenos positivos (resolvido pela soma de logs); probabilidade zero quebra o log em si (\(\ln 0=-\infty\)), um problema que a soma de logs não resolve — é a suavização, uma técnica separada, que evita isso.
Dica(Resposta) Teste 9 — A escolha de família por atributo
- ✔ Verdadeiro — O algoritmo mecanicamente ainda calcula uma densidade Gaussiana para qualquer valor numérico de entrada — ele “roda” sem erro — mas essa densidade não reflete corretamente a estrutura discreta dos 5 níveis categóricos; o modelo é mal especificado, mesmo que produza um número.
- ✔ Verdadeiro — Uma Categórica com \(M\) níveis tem \(M-1\) parâmetros livres (o último é determinado pela restrição de soma 1); com \(M=2\), isso dá exatamente \(1\) parâmetro livre — a própria parametrização da Bernoulli.
- ✔ Verdadeiro — É exatamente a flexibilidade de misturar Gaussiana, Categórica e Bernoulli por coluna, aplicada a um exemplo médico concreto e realista com três tipos de atributo diferentes.
- ✗ Falso — Cada termo é o log da verossimilhança daquele atributo, comparado entre classes — o que importa é a comparação entre classes para o mesmo atributo, não a compatibilidade “de escala” entre atributos diferentes. Eventuais diferenças de escala entre famílias afetam igualmente todas as classes e não impedem a soma nem distorcem o argmax.
Dica(Resposta) Teste 10 — O caso binário: custo e priori viram um limiar
- ✔ Verdadeiro — Com \(t=c_{II}/(c_I+c_{II})\), conforme a razão de custos cresce sem limite, o limiar ótimo tende a \(1\), deslocando-se cada vez mais para o extremo.
- ✔ Verdadeiro — A coincidência entre regra de Bayes e regra do posterior máximo é uma peculiaridade da perda 0-1; sob perda assimétrica, a regra ótima passa a depender do valor da posteriori em relação a um limiar deslocado, não só de qual classe tem a maior posteriori.
- ✔ Verdadeiro — É o mesmo mecanismo de deslocamento de limiar do caso binário geral, aplicado a controle de qualidade industrial: um custo assimétrico de \(20\times\) desloca o limiar bem para longe de \(50\%\), na direção de detectar mais defeitos à custa de mais falsos alarmes.
- ✗ Falso — A posteriori é uma quantidade estatística, calculada a partir dos dados e do modelo — ela não sabe nada sobre custos. Os custos entram só na hora de decidir o que fazer com a posteriori (onde colocar o limiar), nunca no cálculo da posteriori em si.
Dica(Resposta) Teste 11 — Risco de Bayes e a ressalva que importa
- ✔ Verdadeiro — Densidades idênticas eliminam qualquer informação discriminativa em \(\mathbf{x}\); o melhor que se pode fazer é sempre prever a classe majoritária, com erro \(\min(\pi_A,\pi_B)\) — o teto do risco de Bayes para prioris fixas quando não há nenhum sinal discriminativo disponível.
- ✗ Falso — É exatamente “a ressalva que importa”: a regra de Bayes é ótima se a posteriori usada estiver certa. Se o modelo estiver errado, a regra calculada a partir dele é ótima em relação a esse modelo, não necessariamente em relação ao mundo real.
- ✔ Verdadeiro — É o mesmo fenômeno de “classifica bem, estima mal” transferido para risco de crédito: sob perda 0-1, o que importa é o ranking correto entre bom/mau pagador, não a calibração exata das probabilidades — um modelo mal especificado ainda pode decidir bem na maioria dos casos.
- ✗ Falso — A teoria da decisão otimiza a ação dado um modelo assumido — ela nunca verifica, nem garante, que esse modelo é o processo real que gerou os dados. Confundir “a regra é ótima dado o modelo” com “o modelo está correto” é exatamente a ressalva que este bloco existe para destacar.
Dica(Resposta) Teste 12 — O exemplo do e-mail: “grátis” e “ganhador”
- ✔ Verdadeiro — Se \(p(\text{grátis}\mid c)=g\) para todo \(c\) (constante), então \(p(\text{grátis},\text{ganhador})=\sum_c\pi_c\,g\,p(\text{ganhador}\mid c)=g\sum_c\pi_c\,p(\text{ganhador}\mid c)=g\cdot p(\text{ganhador})=p(\text{grátis})p(\text{ganhador})\) — a independência marginal emerge quando “grátis” deixa de depender da classe.
- ✔ Verdadeiro — Verificado numericamente: com \(\pi_{\text{spam}}=0{,}5\), o “gap” entre a conjunta e o produto das marginais é \(\approx0{,}119\); com \(\pi_{\text{spam}}=0{,}99\), cai para \(\approx0{,}005\). Quando a classe fica quase determinística (quase tudo é spam), ela deixa de funcionar como um “mixer” eficaz entre os dois regimes condicionais bem diferentes, e a dependência induzida encolhe.
- ✔ Verdadeiro — É a mesma estrutura causal exata (o diagnóstico afeta as taxas de ambos os sintomas, gerando dependência marginal entre eles, mesmo que sejam condicionalmente independentes dado o diagnóstico) — um exemplo clássico de raciocínio probabilístico médico, análogo ao do e-mail.
- ✗ Falso — O exemplo foi construído deliberadamente para satisfazer a suposição do Naive Bayes exatamente — isso não generaliza para dados reais de spam, onde a independência condicional quase certamente é violada em algum grau. Um caso ilustrativo satisfazer a suposição por construção não implica que dados reais também a satisfaçam.