Aula 1: Modelos Generativos Paramétricos e Detecção de Anomalias
Aprendizado Não Supervisionado
Marcos M. Raimundo — Instituto de Computação, UNICAMP
2026-08-10
Abertura — modelar dados sem rótulos
Sem rótulo \(y\) — só \(\mathbf{x}_1,\dots,\mathbf{x}_N\).
Que forma esses dados têm?
Profiling: descrever o comportamento típico, depois reconhecer o desvio. Um sensor de temperatura e um de vibração que variam juntos sob operação normal — um ponto novo se parece com isso?
Caminho da aula: assumir uma família teórica → ajustar → usar a verossimilhança para decidir o que é típico.
flowchart LR
A["dados sem rótulo"] --> B["assumir família teórica<br/>(Gaussiana multivariada)"]
B --> C["ajustar por máxima<br/>verossimilhança"]
C --> D["distância de Mahalanobis<br/>de um ponto novo"]
D --> E["p-valor via χ²_d"]
E --> F["decisão: típico ou anômalo"]
Distribuição Empírica vs. Teórica
Distribuição empírica: o histograma/a nuvem de pontos em si. Nunca “errada”, mas ruidosa e não generaliza.
Aposta desta aula: assumir uma família teórica com poucos parâmetros — troca ruído por estrutura, ao custo de a suposição poder estar errada.