|
Sia LDA che la regressione logistica conducono ad una frontiera decisionale lineare. Tuttavia i criteri utilizzati per determinare tale frontiera sono profondamente differenti.
SVM (CV95), come LDA e la regressione logistica, permette di ottenere un classificatore lineare basato su una funzione discriminante della forma mostrata in equazione (5.6). Tuttavia l'approccio seguito è differente. L'obiettivo di SVM consiste infatti nel determinare, tra tutti gli iperpiani che separano correttamente le due classi, quello che massimizza il margine di separazione tra gli esempi di addestramento e la frontiera decisionale (decision boundary). L'idea alla base di questo approccio è che un margine più ampio conduca generalmente ad una migliore capacità di generalizzazione del classificatore e ad una maggiore robustezza rispetto alle variazioni presenti nei dati.
Siano pertanto definite come classi di classificazione quelle tipiche di un problema binario nella forma
e si faccia riferimento all'iperpiano di formula (5.5).
Supponiamo che esistano dei parametri
ottimi tali che soddisfino il vincolo
Si può supporre che esistano, per ognuna delle categorie, uno o più vettori per i quali il vincolo (5.43) sia soddisfatto con uguaglianza. Tali elementi prendono il nome di Support Vectors. Essi sono i campioni che determinano il margine di separazione e, come verrà mostrato in seguito attraverso le condizioni KKT, sono gli unici campioni associati a moltiplicatori di Lagrange non nulli.
La distanza punto-piano (cfr. eq.(1.88)) vale
Per massimizzare il margine dell'equazione (5.45) bisogna minimizzare la sua inversa, ovvero
Questa classe di problemi (minimizzazione con vincoli come disuguaglianze o primal optimization problem) si risolvono utilizzando l'approccio di Karush-Kuhn-Tucker che è il metodo dei moltiplicatori di Lagrange generalizzato a disuguaglianze.
Attraverso le condizioni KKT si ottiene la funzione lagrangiana:
Su questa relazione sono valide le condizioni KKT tra le quali è di notevole importanza il vincolo, detto di Complementary slackness,
| (5.52) |
Risolvendo il problema quadratico (5.50), sotto il vincolo (5.48) e
, i pesi che presentano
saranno i Support Vectors.
Tali pesi, inseriti nelle equazioni (5.49) e (5.51), porteranno a ricavare l'iperpiano di massimo margine.
Il metodo più usato per risolvere questo problema QP è il Sequential Minimal Optimization (SMO). Per una trattazione approfondita delle tematiche legate a SVM si può fare riferimento a (SS02).