Il classificatore bayesiano

La sezione precedente ha mostrato come il classificatore bayesiano ottimo possa essere espresso nella forma


\begin{displaymath}
\hat y(\mathbf{x})
=
\argmax_i p(\mathbf{x}\vert y_i)\pi_i,
\end{displaymath} (5.24)

dove $\pi_i=p(y_i)$ rappresenta la probabilità a priori della classe $i$.

Nella pratica le probabilità a priori e le densità condizionate $p(\mathbf{x}\vert y_i)$ non sono generalmente note e devono essere stimate a partire da un insieme di esempi etichettati (training set).

Per modellare le densità condizionate si ricorre normalmente a un approccio parametrico, assumendo una famiglia di distribuzioni descritta da un numero finito di parametri. Quando appropriato, tali densità vengono modellate mediante distribuzioni gaussiane oppure mediante altre famiglie di distribuzioni parametriche.

Le tecniche più utilizzate per la stima dei parametri sono la Maximum Likelihood Estimation (MLE) e la stima bayesiana. Pur basandosi su principi differenti, entrambe conducono spesso a risultati simili quando è disponibile una quantità sufficiente di dati. La distribuzione gaussiana costituisce spesso una buona approssimazione statistica per molti problemi di pattern recognition.

Si consideri il caso, molto comune, in cui le densità condizionate


\begin{displaymath}
p(\mathbf{x}\vert y_i)
\end{displaymath} (5.25)

siano gaussiane multivariate di media $\boldsymbol\mu_i$ e matrice di covarianza $\boldsymbol\Sigma_i$.

In tale ipotesi il classificatore bayesiano ottimo, ottenuto mediante la regola MAP (Maximum A Posteriori), assume la forma


\begin{displaymath}
\begin{array}{rl}
\hat{y}(\mathbf{x})
&=
\argmax_i
p(\...
...et(\boldsymbol\Sigma_i)
-
2\log\pi_i
\right].
\end{array}
\end{displaymath} (5.26)

L'ultima espressione si ottiene applicando il logaritmo alla densità gaussiana e trascurando i termini costanti indipendenti dalla classe, equivalentemente a quanto avviene nella minimizzazione della negative log-likelihood (sezione 2.7).

I tre contributi che compaiono nella funzione discriminante hanno una chiara interpretazione statistica:

Nel caso in cui tutte le classi abbiano la stessa probabilità a priori, il termine $-2\log\pi_i$ risulta costante e pụ essere eliminato dalla regola decisionale.

Se inoltre tutte le classi condividono la medesima matrice di covarianza


\begin{displaymath}
\boldsymbol\Sigma_i=\boldsymbol\Sigma,
\end{displaymath} (5.27)

anche il termine $\log\det(\boldsymbol\Sigma_i)$ diviene costante. In tale situazione il classificatore bayesiano si riduce alla ricerca della classe che minimizza la distanza di Mahalanobis (sezione 2.4) tra il campione osservato e le diverse classi del problema.

Paolo medici
2026-10-06