Il problema di Boosting si può generalizzare e può essere visto come un problema dove è necessario cercare dei predittori
che minimizzino la funzione costo globale:
| (5.109) |
Dal punto di vista analitico, AdaBoost è un esempio di ottimizzatore a discesa del gradiente (coordinate-wise gradient descent) che minimizza la potential function
, ottimizzando un coefficiente
per volta (LS10), come si vede dall'equazione (5.98).
Un elenco, non esaustivo ma che permette di fare luce su alcune peculiarità di questa tecnica, delle varianti di AdaBoost è:
AdaBoost può essere esteso anche a casi di classificatori con astensione, dove le uscite possibili sono
.
Ampliando la definizione (5.101), per semplicità si indichino con
gli insuccessi,
le astensioni e
i successi del classificatore
.
Anche in questo caso assume il minimo con lo stesso valore di
del caso senza astensione, cfr. (5.107),
e con tale scelta
varrebbe
| (5.110) |
Tuttavia esiste una scelta più conservativa di proposta da Freund e Schapire
| (5.111) |
Real AdaBoost generalizza il caso precedente ma soprattutto generalizza lo stesso modello additivo esteso (FHT00).
Invece che usare ipotesi dicotomiche e associare ad esse un peso
si cerca direttamente la feature
che minimizza l'equazione (5.98).
Real AdaBoost permette di usare classificatori deboli che forniscono la distribuzione di probabilità
, probabilità che la classe
sia effettivamente
data l'osservazione della caratteristica
.
Data una distribuzione di probabilità , la feature
, che minimizza l'equazione (5.98), è
Sia Discrete che Real AdaBoost, scegliendo un classificatore debole che rispetti l'equazione 5.112, fanno in modo che AdaBoost converga asintoticamente a
Real AdaBoost può essere usato anche con un classificatore discreto come il Decision Stump.
Applicando direttamente l'equazione (5.112) ai due possibili stati di uscita del Decision Stump (risulta comunque facile ottenere il minimo di per via algebrica) le risposte del classificatore devono assumere i valori
| (5.114) |
| (5.115) |
Gentle AdaBoost generalizza ulteriormente il concetto di Ensemble Learning a modello additivo (FHT00) usando una regressione con passi tipici dei metodi di Newton:
| (5.116) |
L'ipotesi , da aggiungere al modello additivo all'iterazione
, viene scelta fra tutte le possibili ipotesi
come quella che ottimizza una regressione ai minimi quadrati pesata
Anche Gentle AdaBoost può essere usato con il Decision Stump.
In questo caso il minimo di (5.117) dell'algoritmo di decisione assume una forma notevole in
| (5.118) |
Per motivi storici, AdaBoost non nasce da una formulazione
probabilistica esplicita. Una prima osservazione è che l'uscita del
classificatore non rappresenta direttamente una probabilità: il valore
prodotto dalla combinazione dei classificatori deboli può infatti
assumere qualsiasi valore reale e non è limitato all'intervallo
.
Inoltre, la funzione costo minimizzata da AdaBoost non deriva direttamente da un principio di massima verosimiglianza, come avviene in molti modelli statistici. Tuttavia, è possibile dimostrare che la funzione esponenziale utilizzata da AdaBoost costituisce una buona approssimazione della perdita logistica e che il classificatore può essere interpretato come un modello additivo per la stima di probabilità.
Questa osservazione conduce naturalmente alla regressione logistica e alla definizione di algoritmi di boosting derivati da criteri statistici. In particolare, LogitBoost costruisce un modello additivo ottimizzando direttamente la verosimiglianza di un modello Bernoulliano.
La regressione logistica additiva assume la forma
dove rappresenta la somma dei classificatori deboli generati
durante il processo di boosting.
Invertendo la relazione precedente si ottiene
che associa una probabilità al modello additivo .
L'obiettivo dell'addestramento è quindi stimare la funzione
massimizzando la verosimiglianza del modello Bernoulliano. Tale
problema è equivalente alla minimizzazione della log-loss
| (5.121) |
LogitBoost costruisce iterativamente il modello additivo mediante passi di Newton applicati alla log-verosimiglianza. A ogni iterazione vengono introdotti una risposta di lavoro (working response) e un insieme di pesi ottenuti dalla corrente stima della probabilità:
| (5.122) |
| (5.123) |
dove
| (5.124) |
L'ipotesi debole viene quindi ottenuta come regressione ai
minimi quadrati pesati della variabile
rispetto alle osservazioni
, utilizzando i pesi
. Dopo ogni iterazione, la funzione
additiva viene aggiornata e una nuova stima delle probabilità viene
calcolata mediante l'equazione (5.120).
A differenza di AdaBoost, che nasce come metodo di ricampionamento adattativo e possiede soltanto una successiva interpretazione statistica, LogitBoost deriva direttamente da un modello probabilistico e ottimizza esplicitamente la Bernoulli log-likelihood.
Questo comportamento può essere rappresentato da una funzione costo del tipo
| (5.125) |
Paolo medici