I classificatori introdotti finora sono stati presentati principalmente nel contesto binario. Nella pratica, molti problemi di classificazione richiedono tuttavia di distinguere simultaneamente tra più categorie. È pertanto necessario estendere il formalismo delle funzioni di perdita e dei classificatori lineari al caso multiclasse.
Nel caso di classificazione binaria, considerato nelle sezioni precedenti, un classificatore lineare restituisce un singolo valore
| (5.80) |
| (5.81) |
| (5.82) |
Gli score non rappresentano necessariamente delle probabilità e il loro valore assoluto non ha in generale un significato diretto. Il problema della classificazione consiste quindi nel confrontare gli score delle diverse classi e assegnare il campione alla classe con score maggiore.
Anche nel caso multiclasse è possibile definire una funzione di perdita che quantifichi quanto gli score prodotti dal classificatore siano compatibili con la classe corretta. Come discusso nella sezione 5.6, la scelta della funzione di perdita determina in modo sostanziale il criterio con cui viene addestrato il classificatore.
Una prima possibilità consiste nell'estendere al caso multiclasse il concetto di hinge loss introdotto per la SVM nella sezione 5.5. Indicando con la classe corretta del campione
-esimo e con
lo score associato alla classe
, si può definire la multiclass SVM loss come
| (5.83) |
La perdita è nulla quando lo score della classe corretta supera quello di ogni altra classe di almeno un margine pari a . In caso contrario, viene penalizzata ogni classe che viola tale margine. La formulazione è quindi una naturale estensione della hinge loss binaria, nella quale il margine viene valutato rispetto a tutte le classi concorrenti.
Una variante consiste nella squared hinge loss, nella quale la penalizzazione viene elevata al quadrato:
| (5.84) |
La funzione di perdita complessiva può quindi essere ottenuta come media delle perdite sui campioni, eventualmente aggiungendo un termine di regolarizzazione:
| (5.85) |
La cross-entropy può essere estesa naturalmente al caso multiclasse introducendo una parametrizzazione probabilistica delle classi attraverso la funzione Softmax.
Gli score vengono trasformati in probabilità attraverso
| (5.86) |
La perdita associata al campione -esimo è quindi la cross-entropy della classe corretta:
| (5.87) |
La formulazione è l'estensione al caso multiclasse della cross-entropy introdotta nella sezione 5.6. Poiché la minimizzazione della cross-entropy equivale alla minimizzazione della negative log-likelihood della classe osservata, il modello può essere interpretato come uno stimatore a massima verosimiglianza.
Anche in questo caso è possibile introdurre un termine di regolarizzazione:
| (5.88) |
Da un punto di vista statistico, il termine di regolarizzazione può essere interpretato come l'introduzione di un'informazione a priori sui parametri del modello. In questa interpretazione la stima non è più una semplice stima di massima verosimiglianza, ma una stima Maximum A Posteriori (MAP).
Le funzioni di perdita forniscono quindi un linguaggio comune per descrivere numerosi algoritmi di classificazione. Un approccio alternativo consiste nel combinare più classificatori semplici per costruire un classificatore più complesso, secondo il paradigma dell'Ensemble Learning.
Paolo medici