Aula 1: Modelos Generativos Paramétricos e Detecção de Anomalias

Aprendizado Não Supervisionado

Marcos M. Raimundo — Instituto de Computação, UNICAMP

2026-08-10

Abertura — modelar dados sem rótulos

Sem rótulo \(y\) — só \(\mathbf{x}_1,\dots,\mathbf{x}_N\).

Que forma esses dados têm?

Profiling: descrever o comportamento típico, depois reconhecer o desvio. Um sensor de temperatura e um de vibração que variam juntos sob operação normal — um ponto novo se parece com isso?

Caminho da aula: assumir uma família teórica → ajustar → usar a verossimilhança para decidir o que é típico.

flowchart LR
    A["dados sem rótulo"] --> B["assumir família teórica<br/>(Gaussiana multivariada)"]
    B --> C["ajustar por máxima<br/>verossimilhança"]
    C --> D["distância de Mahalanobis<br/>de um ponto novo"]
    D --> E["p-valor via χ²_d"]
    E --> F["decisão: típico ou anômalo"]

Distribuição Empírica vs. Teórica

Distribuição empírica: o histograma/a nuvem de pontos em si. Nunca “errada”, mas ruidosa e não generaliza.

Aposta desta aula: assumir uma família teórica com poucos parâmetros — troca ruído por estrutura, ao custo de a suposição poder estar errada.

A Gaussiana Multivariada: Forma e Parâmetros

\[ \mathcal{N}(\mathbf{x}\mid\boldsymbol\mu,\Sigma) = \frac{1}{(2\pi)^{d/2}|\Sigma|^{1/2}} \exp\left\{-\tfrac12(\mathbf{x}-\boldsymbol\mu)^T\Sigma^{-1}(\mathbf{x}-\boldsymbol\mu)\right\} \]

  • \(\boldsymbol\mu\): centro. \(\Sigma\): forma (autovetores = orientação, autovalores = comprimento dos eixos).
  • Curvas de nível = elipsoides centrados em \(\boldsymbol\mu\).

Por que a Gaussiana? Máxima entropia dada média/covariância; Teorema Central do Limite (soma de muitos efeitos pequenos).

Ajuste por Máxima Verossimilhança

\[ \hat{\boldsymbol\mu} = \frac1N\sum_n \mathbf{x}_n \qquad \hat\Sigma_{\text{ML}} = \frac1N\sum_n(\mathbf{x}_n-\hat{\boldsymbol\mu})(\mathbf{x}_n-\hat{\boldsymbol\mu})^T \]

Viés: \(\mathbb{E}[\hat\Sigma_{\text{ML}}] = \frac{N-1}{N}\Sigma\). Correção: dividir por \(N-1\) (np.cov padrão).

Se \(N\le d\): \(\hat\Sigma\) não é invertível. Sem inversa, sem Mahalanobis, sem verossimilhança. Antecipa a maldição da dimensionalidade da Aula 2.

Da Verossimilhança à Distância de Mahalanobis

\[ D_M(\mathbf{x})^2 = (\mathbf{x}-\hat{\boldsymbol\mu})^T\hat\Sigma^{-1}(\mathbf{x}-\hat{\boldsymbol\mu}) \]

“Reduz à Euclidiana quando \(\Sigma=I\)” — em geral, não é a Euclidiana.

\(\Sigma^{-1}\) estica nas direções de baixa variância, comprime nas de alta variância.

Da Posição ao \(p\)-valor

Do limiar ao \(p\)-valor

\(D_M(\mathbf{x})^2 \sim \chi^2_d\) (resultado clássico, verificado no 01-fontes.md, não vem de PRML/DLFC).

\[ p(\mathbf{x}) = 1 - F_{\chi^2_d}\big(D_M(\mathbf{x})^2\big) \]

“Probabilidade de um ponto do modelo ajustado ser tão extremo quanto \(\mathbf{x}\)” — não “probabilidade de \(\mathbf{x}\) vir do modelo certo”.

Limiar fixo = caso particular \(p(\mathbf{x})<\alpha\). \(p\)-valor ordena por surpresa em vez de só separar em duas caixas.

Conjunta vs. por dimensão

\(\hat\Sigma\) diagonal = supor independência (PRML p. 84: mais rápido de inverter, mas “limita a capacidade de capturar correlações interessantes”).

Por dimensão: \(p_i(x_i)\) da marginal \(\mathcal{N}(\hat\mu_i,\hat\sigma_i^2)\). Combinado por Fisher: \(-2\sum_i\ln p_i \sim \chi^2_{2d}\).

flowchart TD
    X["ponto novo x"] --> Q{"supor independência<br/>entre dimensões?"}
    Q -->|"sim"| M1["p-valor por dimensão<br/>(d parâmetros)"]
    M1 --> F1["combinar via Fisher<br/>-2 Σ ln p_i ~ χ²_2d"]
    Q -->|"não"| M2["distância de Mahalanobis<br/>(d(d+1)/2 parâmetros)"]
    M2 --> F2["p-valor conjunto<br/>via χ²_d"]
    F1 --> R["cego à correlação entre dimensões"]
    F2 --> R2["sensível à correlação — mais caro"]

Armadilhas e Ponte para a Aula 2

  1. Multimodalidade: uma Gaussiana só descreve uma média cega entre subpopulações distintas.
  2. Outliers no ajuste: inflam \(\hat\Sigma\), escondem o que se queria detectar. Problema de robustez, não resolvido aqui.

Ponte para a Aula 2

Relaxar a suposição de família única: \(k\)-NN e KDE, densidade não-paramétrica. Preço: a maldição da dimensionalidade.