LDA

Un esempio di riduzione delle dimensioni del problema a scopo di classificazione è la Analisi di Discriminante Lineare Linear Discriminant Analysis (Fisher, 1936).

Se si analizza il funzionamento di PCA (sezione 2.9.1), questa tecnica si limita a massimizzare l'informazione non distinguendo tra loro le eventuali classi che compongono il problema: PCA non considera il fatto che i dati siano rappresentativi di diverse categorie. PCA non è un vero classificatore ma è una tecnica utile a semplificare il problema, riducendone le dimensioni. LDA cerca invece una proiezione che massimizzi la separazione tra le classi rispetto alla variabilità interna alle classi.

Figura 5.2: Analisi di Discriminante Lineare.
Image fig_lda

Nel caso di un problema di due classi, il miglior classificatore bayesiano è quello che permette di individuare il margine di decisione (decision boundary) formato dall'ipersuperficie lungo la quale la probabilità condizionata delle due classi è uguale.

Se si forza l'ipotesi che le due classi del problema binario abbiano distribuzione gaussiana multivariata e uguale matrice di covarianza $\mathbf{\Sigma}$ è facile dimostrare che il margine di decisione bayesiano, equazione (5.26), diventa lineare.

In LDA viene fatta pertanto l'ipotesi di omoschedasticità e, sotto questa ipotesi, si vuole ottenere un vettore $\mathbf{w}$ che permetta di proiettare lo spazio n-dimensionale degli eventi in uno spazio scalare che però massimizzi la separazione tra le classi e permetta di separarle linearmente attraverso un margine di separazione del tipo

\begin{displaymath}
\mathbf{w}^{\top}\mathbf{x} = c
\end{displaymath} (5.29)

Per determinare questa superficie di separazione si possono usare diverse metriche. Sotto il termine LDA attualmente confluiscono diverse tecniche dove la Discriminante di Fisher (Fisher's Linear Discriminant Analysis) risulta la più diffusa in letteratura.

Si può dimostrare che la proiezione che massimizza la separazione tra le due classi dal punto di vista “statistico”, ovvero l'iperpiano di decisione, si ottiene con

\begin{displaymath}
\mathbf{w} = \mathbf{\Sigma} ^{-1} (\boldsymbol\mu_1 - \boldsymbol\mu_2)
\end{displaymath} (5.30)

dove $\mathbf{\Sigma}$ rappresenta la matrice di covarianza intra-classe condivisa. Il valore di separazione ottimo si trova a metà strada tra le proiezioni delle due medie
\begin{displaymath}
c = \frac{1}{2}\mathbf{w}^{\top} \left( \boldsymbol\mu_1+\boldsymbol\mu_2 \right)
\end{displaymath} (5.31)

nel caso in cui le probabilità a priori dei due insiemi siano identiche. La frontiera decisionale assume pertanto la forma
\begin{displaymath}
\mathbf{w}^{\top}\mathbf{x} = c
\end{displaymath} (5.32)

Questo margine di decisione coincide con il classificatore di Bayes nell'ipotesi che le classi siano descritte da distribuzioni gaussiane con identica matrice di covarianza. In tali condizioni la frontiera decisionale è lineare. Tuttavia tale approccio richiede di modellare esplicitamente la distribuzione statistica delle osservazioni all'interno di ciascuna classe. Un'alternativa consiste nel modellare direttamente la probabilità a posteriori delle categorie senza formulare ipotesi sulla distribuzione dei dati: questa è l'idea alla base della regressione logistica.

Paolo medici
2026-10-06