Nonostante il Soft Margin, alcuni problemi sono intrinsecamente non separabili nello spazio delle feature.
Tuttavia, dalla conoscenza del problema, è possibile intuire che una trasformazione non lineare trasforma lo spazio delle feature di input
nello spazio delle feature
dove l'iperpiano di separazione permette di discriminare meglio le categorie.
La funzione discriminante nello spazio
è
| (5.59) |
Per permettere la separazione, normalmente lo spazio è di dimensioni maggiori dello spazio
.
Questo aumento di dimensioni renderebbe costoso calcolare esplicitamente le coordinate dei campioni nello spazio
.
I metodi Kernel permettono di lavorare nello spazio trasformato senza doverne calcolare esplicitamente le coordinate.
Il vettore è una combinazione lineare dei campioni di addestramento (i support vector nel caso hard margin):
| (5.60) |
Al momento della valutazione della funzione discriminante pertanto è richiesto l'utilizzo dei vettori di supporto (almeno quelli con un parametro associato non trascurabile).
Di fatto SVM con kernel individua alcuni campioni dell'insieme di addestramento come informazione utile per capire quanto vicino a loro è il campione di valutazione in esame.
Per un vettore di supporto che soddisfa le condizioni di margine, il termine di bias può essere ottenuto da
| (5.62) |
I kernel più diffusi, in quanto semplici da valutare, sono i kernel gaussiani nella forma
| (5.63) |
| (5.64) |
| (5.65) |
L'utilizzo di funzioni kernel, unita alla possibilità di precalcolare tutte le combinazioni
, permette di definire un'interfaccia comune tra gli addestramenti lineari e i non lineari, mantenendo di fatto lo stesso grado di prestazioni.
È interessante osservare che la funzione discriminante può essere espressa esclusivamente mediante valutazioni della funzione kernel
| (5.66) |
Da questo punto di vista, il classificatore realizza una forma di template matching, nella quale il campione viene confrontato con i vettori di supporto mediante la funzione kernel.
Abbiamo quindi visto come un classificatore possa essere costruito imponendo direttamente una geometria della separazione tra le classi. La formulazione mediante hinge loss permette tuttavia di ricondurre anche SVM al quadro più generale della minimizzazione del rischio empirico che verrà introdotto nella sezione successiva.
Paolo medici