Il teorema di Bayes

La definizione di probabilità condizionata permette di ottenere il seguente risultato fondamentale.

Teorema 3 (di Bayes)   Sia $(\Omega,\mathcal{F},p)$ uno spazio probabilizzato e siano $y_1,\ldots,y_n$ eventi che formano una partizione di $\Omega$, con


\begin{displaymath}
p(y_i)>0
\qquad \forall i=1,\ldots,n.
\end{displaymath} (5.8)

Allora, per ogni osservazione $x$ tale che $p(x)>0$, vale


\begin{displaymath}
p(y_i\vert x)
=
\frac{p(y_i)\,p(x\vert y_i)}
{\sum_{j=1}^{n} p(y_j)\,p(x\vert y_j)}
\end{displaymath} (5.9)

per ogni $i=1, \ldots, n$.

Il teorema di Bayes costituisce uno dei risultati fondamentali della statistica inferenziale e dell'apprendimento automatico. Esso permette di aggiornare una conoscenza iniziale relativa a un insieme di ipotesi alla luce di una nuova osservazione.

Le classi $y_i$, con $i=1, \ldots, n$, possono essere interpretate come un insieme di possibili cause, mentre l'osservazione $x$ rappresenta l'evidenza disponibile. Il teorema di Bayes consente quindi di calcolare la probabilità che ciascuna causa sia responsabile dell'osservazione effettuata.

Le probabilità

\begin{displaymath}
p(y_i)
\end{displaymath} (5.10)

prendono il nome di probabilità a priori (spesso indicate con $\pi_i$) e rappresentano le conoscenze disponibili prima di osservare il dato $x$.

Le quantità

\begin{displaymath}
p(x\vert y_i)
\end{displaymath} (5.11)

descrivono invece la distribuzione dell'osservazione $x$ sotto l'ipotesi che la classe corretta sia $y_i$ e costituiscono la verosimiglianza associata alla classe $y_i$.

Combinando le probabilità a priori con l'informazione contenuta nell'osservazione $x$, il teorema di Bayes permette di ottenere le probabilità

\begin{displaymath}
p(y_i\vert x),
\end{displaymath} (5.12)

dette probabilità a posteriori. Esse rappresentano la probabilità che il campione osservato appartenga alla classe $y_i$ dopo aver osservato il dato $x$.

Poiché

\begin{displaymath}
p(x)
=
\sum_{j=1}^{n} p(y_j)p(x\vert y_j),
\end{displaymath} (5.13)

la formula di Bayes può essere riscritta nella forma
\begin{displaymath}
p(y_i\vert x)
=
\frac{p(x\vert y_i)p(y_i)}
{p(x)}.
\end{displaymath} (5.14)

Consideriamo, ad esempio, un problema di classificazione tra mele e arance. Siano

\begin{displaymath}
y_1=\text{mela}
\qquad
y_2=\text{arancia}
\end{displaymath} (5.15)

le due classi possibili e sia $x$ una variabile casuale che descrive una caratteristica osservabile del frutto, ad esempio il colore.

Con tale notazione,

\begin{displaymath}
p(x\vert y_1)
\end{displaymath} (5.16)

rappresenta la densità (o probabilità, nel caso discreto) di osservare il colore $x$ sapendo che il frutto appartiene alla classe mela, mentre
\begin{displaymath}
p(x\vert y_2)
\end{displaymath} (5.17)

rappresenta la corrispondente distribuzione per la classe arancia.

Durante la fase di addestramento è possibile stimare le distribuzioni

\begin{displaymath}
p(x\vert y_1)
\qquad \text{e} \qquad
p(x\vert y_2)
\end{displaymath} (5.18)

a partire dagli esempi disponibili. Allo stesso modo possono essere stimate le probabilità a priori
\begin{displaymath}
p(y_1)
\qquad \text{e} \qquad
p(y_2),
\end{displaymath} (5.19)

che rappresentano le frequenze relative delle mele e delle arance nella popolazione considerata.

L'obiettivo consiste nel determinare la probabilità che un frutto appartenga alla classe mela oppure alla classe arancia dopo aver osservato una particolare caratteristica $x$.

Osservato un determinato valore di $x$, si assegnerà il campione alla classe che presenta la probabilità a posteriori maggiore. Nel caso binario, la decisione sarà

\begin{displaymath}
p(y_1\vert x) > p(y_2\vert x).
\end{displaymath} (5.20)

Sfruttando la formula di Bayes, tale regola può essere scritta come
\begin{displaymath}
p(x\vert y_1)p(y_1)
>
p(x\vert y_2)p(y_2),
\end{displaymath} (5.21)

poiché il termine $p(x)$ compare al denominatore di entrambe le probabilità a posteriori e non influenza la decisione finale.

In generale, per $n$ classi, il classificatore bayesiano può essere espresso mediante la seguente funzione discriminante:

\begin{displaymath}
\hat y(x)
=
\argmax_i p(y_i\vert x)
=
\argmax_i p(x\vert y_i)\pi_i.
\end{displaymath} (5.22)

È inoltre possibile valutare la probabilità di errore associata a una particolare osservazione $x$. Poiché il classificatore assegna il campione alla classe con probabilità a posteriori massima, la probabilità di errore condizionata all'osservazione risulta

\begin{displaymath}
P(\text{errore}\vert x)
=
1-\max_i p(y_i\vert x).
\end{displaymath} (5.23)

Paolo medici
2026-10-06