La regressione logistica rappresenta uno dei classificatori lineari più semplici e diffusi in ambito statistico e di machine learning. A differenza di LDA, che deriva da ipotesi probabilistiche sulle distribuzioni delle classi, la regressione logistica modella direttamente la probabilità a posteriori delle categorie e viene per questo motivo classificata come metodo discriminativo.
Come per gli altri classificatori lineari, si considera una funzione discriminante della forma
| (5.33) |
dove è il vettore dei pesi e
il termine di bias.
Nel caso binario, assumendo etichette
,
la probabilità che il campione
appartenga alla classe positiva viene modellata mediante la funzione logistica
| (5.34) |
mentre la probabilità della classe negativa vale
| (5.35) |
La funzione logistica trasforma il valore reale della funzione discriminante in una probabilità compresa tra e
.
La superficie di separazione tra le due classi corrisponde alla condizione
| (5.36) |
ovvero
| (5.37) |
che coincide con un iperpiano lineare.
L'addestramento consiste nella stima dei parametri e
che massimizzano la verosimiglianza dei dati osservati.
Dato un insieme di addestramento
,
la log-verosimiglianza si scrive
| (5.38) |
dove
| (5.39) |
Massimizzare la log-verosimiglianza equivale a minimizzare la funzione costo
| (5.40) |
nota come cross-entropy loss o log-loss.
A differenza di LDA, la regressione logistica non richiede alcuna ipotesi sulla distribuzione delle classi e può quindi essere applicata anche quando le osservazioni non seguono una distribuzione gaussiana. D'altra parte, come tutti i classificatori lineari, può separare correttamente solo classi linearmente separabili nello spazio delle caratteristiche.
La regressione logistica può essere interpretata come una versione probabilistica dei classificatori lineari.
Il valore rappresenta infatti il logaritmo del rapporto tra le probabilità delle due classi
| (5.41) |
e viene spesso chiamato log-odds o logit.
Paolo medici