3 A Distribuição Normal Multivariada
O vetor de médias e a matriz de covariâncias descrevem o centro e a variabilidade de um vetor aleatório, mas não determinam sozinhos toda a sua distribuição. A distribuição Normal Multivariada (NMV) é um modelo de referência particularmente útil quando a nuvem de dados tem forma aproximadamente elíptica e quando queremos usar resultados inferenciais clássicos. Ela não deve ser tomada como descrição automática de qualquer conjunto de dados.
Um vetor aleatório \(\boldsymbol{x}\) de dimensão \(p\) segue uma distribuição Normal Multivariada com vetor de médias \(\boldsymbol{\mu}\) e matriz de covariâncias positiva-definida \(\boldsymbol{\Sigma}\), denotada por \(\boldsymbol{x}\sim N_p(\boldsymbol{\mu},\boldsymbol{\Sigma})\), se tem função de densidade
\[ f(\boldsymbol{x})= \frac{1}{(2\pi)^{p/2}|\boldsymbol{\Sigma}|^{1/2}} \exp\left\{-\frac{1}{2}(\boldsymbol{x}-\boldsymbol{\mu})^T \boldsymbol{\Sigma}^{-1}(\boldsymbol{x}-\boldsymbol{\mu})\right\}. \]
O termo no expoente é a distância de Mahalanobis ao quadrado entre \(\boldsymbol{x}\) e o centro da distribuição:
\[ d_M^2(\boldsymbol{x},\boldsymbol{\mu})= (\boldsymbol{x}-\boldsymbol{\mu})^T\boldsymbol{\Sigma}^{-1} (\boldsymbol{x}-\boldsymbol{\mu}). \]
Ele considera simultaneamente a escala de cada variável e sua associação com as demais. Pontos com maior distância de Mahalanobis ao centro recebem menor densidade. A inversa e o determinante presentes na densidade existem porque, neste capítulo, \(\boldsymbol{\Sigma}\) é positiva-definida.
3.1 Propriedades da Distribuição Normal Multivariada
As propriedades a seguir explicam por que esse modelo aparece com frequência na teoria multivariada.
Transformações lineares. Se \(\boldsymbol{x}\sim N_p(\boldsymbol{\mu},\boldsymbol{\Sigma})\), então, para uma matriz constante \(\boldsymbol{A}\) e um vetor constante \(\boldsymbol{b}\), \[ \boldsymbol{A}\boldsymbol{x}+\boldsymbol{b}\sim N_q(\boldsymbol{A}\boldsymbol{\mu}+\boldsymbol{b}, \boldsymbol{A}\boldsymbol{\Sigma}\boldsymbol{A}^T). \] Em particular, toda combinação linear \(\boldsymbol{a}^T\boldsymbol{x}\) tem distribuição normal univariada.
Distribuições marginais. Qualquer subconjunto das componentes de um vetor NMV também tem distribuição normal multivariada. Por exemplo, se \(\boldsymbol{x}=(X_1,X_2,X_3)^T\) é NMV, então \((X_1,X_3)^T\) também é NMV.
Covariância zero e independência. Em geral, não correlação não implica independência. Para vetores conjuntamente normais, porém, dois subconjuntos são independentes quando toda a matriz de covariâncias cruzadas entre eles é nula.
3.2 Visualizando a Normal Bivariada
No caso bivariado, os conjuntos de pontos com a mesma densidade satisfazem
\[ (\boldsymbol{x}-\boldsymbol{\mu})^T\boldsymbol{\Sigma}^{-1} (\boldsymbol{x}-\boldsymbol{\mu})=c^2. \]
São elipses centradas em \(\boldsymbol{\mu}\). Os autovetores de \(\boldsymbol{\Sigma}\) apontam para seus eixos; os comprimentos dos semieixos são proporcionais às raízes quadradas dos autovalores. A Figura 3.1 mostra três possibilidades.
Quando a covariância é zero e as variâncias são iguais, os contornos são círculos. Com variâncias diferentes e covariância zero, eles permanecem alinhados aos eixos originais. Quando há covariância, os eixos principais se rotacionam.
A normalidade multivariada será uma hipótese importante na análise discriminante e nos modelos de mistura. Já a ACP e o agrupamento hierárquico podem ser calculados sem assumir esse modelo; nele, a normalidade muda principalmente a interpretação inferencial, não a definição do método.