Logistic Regression

La regressione logistica rappresenta uno dei classificatori lineari più semplici e diffusi in ambito statistico e di machine learning. A differenza di LDA, che deriva da ipotesi probabilistiche sulle distribuzioni delle classi, la regressione logistica modella direttamente la probabilità a posteriori delle categorie e viene per questo motivo classificata come metodo discriminativo.

Come per gli altri classificatori lineari, si considera una funzione discriminante della forma


\begin{displaymath}
f(\mathbf{x}) = \mathbf{w}^{\top}\mathbf{x} + b
\end{displaymath} (5.33)

dove $\mathbf{w}$ è il vettore dei pesi e $b$ il termine di bias.

Nel caso binario, assumendo etichette $y \in \{0,1\}$, la probabilità che il campione $\mathbf {x}$ appartenga alla classe positiva viene modellata mediante la funzione logistica


\begin{displaymath}
p(y=1\vert\mathbf{x}) =
\frac{1}{1+e^{-f(\mathbf{x})}}
=
\frac{1}{1+e^{-(\mathbf{w}^{\top}\mathbf{x}+b)}}
\end{displaymath} (5.34)

mentre la probabilità della classe negativa vale


\begin{displaymath}
p(y=0\vert\mathbf{x}) =
1-p(y=1\vert\mathbf{x}).
\end{displaymath} (5.35)

La funzione logistica trasforma il valore reale della funzione discriminante in una probabilità compresa tra $0$ e $1$. La superficie di separazione tra le due classi corrisponde alla condizione


\begin{displaymath}
p(y=1\vert\mathbf{x}) = \frac{1}{2}
\end{displaymath} (5.36)

ovvero


\begin{displaymath}
\mathbf{w}^{\top}\mathbf{x}+b = 0,
\end{displaymath} (5.37)

che coincide con un iperpiano lineare.

L'addestramento consiste nella stima dei parametri $\mathbf{w}$ e $b$ che massimizzano la verosimiglianza dei dati osservati. Dato un insieme di addestramento $\{(\mathbf{x}_i,y_i)\}$, la log-verosimiglianza si scrive


\begin{displaymath}
\log \mathcal{L}(\mathbf{w},b)
=
\sum_i
\left[
y_i \log p_i
+
(1-y_i)\log (1-p_i)
\right]
\end{displaymath} (5.38)

dove


\begin{displaymath}
p_i =
p(y_i=1\vert\mathbf{x}_i).
\end{displaymath} (5.39)

Massimizzare la log-verosimiglianza equivale a minimizzare la funzione costo


\begin{displaymath}
J(\mathbf{w},b)
=
-\sum_i
\left[
y_i \log p_i
+
(1-y_i)\log (1-p_i)
\right]
\end{displaymath} (5.40)

nota come cross-entropy loss o log-loss.

A differenza di LDA, la regressione logistica non richiede alcuna ipotesi sulla distribuzione delle classi e può quindi essere applicata anche quando le osservazioni non seguono una distribuzione gaussiana. D'altra parte, come tutti i classificatori lineari, può separare correttamente solo classi linearmente separabili nello spazio delle caratteristiche.

La regressione logistica può essere interpretata come una versione probabilistica dei classificatori lineari. Il valore $f(\mathbf{x})$ rappresenta infatti il logaritmo del rapporto tra le probabilità delle due classi


\begin{displaymath}
f(\mathbf{x})
=
\log
\frac
{p(y=1\vert\mathbf{x})}
{p(y=0\vert\mathbf{x})}
\end{displaymath} (5.41)

e viene spesso chiamato log-odds o logit.

Paolo medici
2026-10-06