Un modo generale di interpretare molti algoritmi di classificazione consiste nel considerarli come il risultato della minimizzazione di una opportuna funzione di perdita (loss function).
Nel caso dei classificatori lineari introdotti nelle sezioni precedenti, la classificazione viene generalmente ottenuta a partire da una funzione discriminante della forma
| (5.67) |
La regressione logistica (sezione 5.4), ad esempio, interpreta tale funzione attraverso una trasformazione logistica, mentre la SVM (sezione 5.5) utilizza direttamente il valore della funzione discriminante per determinare la classe e il margine di separazione.
Si consideri quindi un classificatore binario e si assumano etichette
| (5.68) |
La quantità
| (5.69) |
viene detta margine funzionale. Il suo segno determina la
correttezza della classificazione: corrisponde a una
classificazione corretta, mentre
identifica un campione
classificato erroneamente.
L'obiettivo ideale di un classificatore consiste nel minimizzare il numero di errori di classificazione. Questo obiettivo può essere espresso mediante la funzione di perdita
| (5.70) |
nota come 0/1 loss.
La minimizzazione diretta della 0/1 loss risulta tuttavia poco conveniente dal punto di vista computazionale. Per questo motivo molti algoritmi di apprendimento utilizzano funzioni di perdita surrogate, ovvero funzioni che approssimano il comportamento della perdita 0/1 ma risultano più semplici da ottimizzare.