Diverse tecniche di classificazione utilizzano differenti funzioni di perdita. La scelta della funzione determina quali caratteristiche degli errori vengono penalizzate maggiormente durante l'addestramento.
La regressione logistica (sezione 5.4) utilizza la logistic loss
| (5.74) |
La perdita diminuisce all'aumentare del margine e continua a penalizzare
anche i campioni correttamente classificati. Per valori negativi di
, corrispondenti a classificazioni errate, la penalizzazione cresce
rapidamente.
È importante osservare che questa perdita coincide con la funzione costo introdotta nella sezione dedicata alla regressione logistica, pur essendo scritta in una forma differente.
Nella regressione logistica le classi sono infatti codificate come e la funzione costo viene espressa come cross-entropy binaria. Utilizzando invece la codifica
e introducendo il margine
, si ottiene esattamente la logistic loss. Si tratta quindi della stessa funzione di perdita scritta con due rappresentazioni differenti del problema.
La SVM con Soft Margin, introdotta nella sezione 5.5, utilizza invece la hinge loss
| (5.75) |
In questo caso i campioni con non contribuiscono più alla
funzione di perdita. La funzione introduce quindi esplicitamente il
margine caratteristico della SVM.
La formulazione primale del problema, introdotta in equazione (5.56), può essere riscritta, utilizzando la hinge loss, nella forma
| (5.76) |
Questa forma rende evidente il collegamento tra la formulazione
originaria della SVM, basata sulle variabili di slack
, e la formulazione basata sulla minimizzazione di una funzione
di perdita.
Un'altra funzione di perdita particolarmente importante nella
classificazione probabilistica è la cross-entropy. Nel caso
multiclasse, con categorie, essa può essere scritta come
| (5.77) |
dove rappresenta la distribuzione target e
la probabilità
assegnata dal modello alla classe
.
Nel caso binario, la cross-entropy assume la forma
| (5.78) |
Questa è la stessa funzione di costo ottenuta dalla massimizzazione della log-verosimiglianza nella regressione logistica (sezione 5.4).
Un'altra funzione di perdita utilizzata negli algoritmi di classificazione è la exponential loss
| (5.79) |
utilizzata, ad esempio, da AdaBoost. Questa funzione penalizza fortemente i campioni con margine negativo e continua ad assegnare un peso decrescente anche ai campioni correttamente classificati.
Le principali funzioni di perdita considerate possono quindi essere confrontate come segue:
| Funzione di perdita | Metodo tipico | Caratteristica principale |
| 0/1 loss | – | errore di classificazione |
| Logistic loss | Logistic Regression | classificazione probabilistica |
| Hinge loss | SVM | massimizzazione del margine |
| Exponential loss | AdaBoost | penalizzazione degli errori |
| Cross-entropy | Modelli probabilistici multiclasse | classificazione probabilistica |
La formulazione mediante funzioni di perdita permette quindi di ricondurre molti algoritmi di classificazione a una struttura comune. La funzione di perdita misura l'errore commesso dal modello, mentre un eventuale termine di regolarizzazione ne limita la complessità. Le differenze tra i vari algoritmi risiedono, tra gli altri aspetti, nella scelta della funzione di perdita, nella forma del modello e nel criterio utilizzato per controllarne la complessità.
Il quadro della minimizzazione del rischio non è limitato alla classificazione binaria. Le stesse idee possono essere estese in maniera naturale al caso multiclasse, come verrà mostrato nella sezione successiva.
Paolo medici