I descrittori presentati nelle sezioni precedenti sono il risultato di una progettazione esplicita da parte dell'operatore. In tutti i casi viene definita una famiglia di trasformazioni dell'immagine (gradienti, confronti binari, convoluzioni, istogrammi) che si ritiene particolarmente adatta a rappresentare le informazioni salienti della scena.
Con l'avvento del Deep Learning questo paradigma è stato gradualmente sostituito da approcci nei quali il descrittore viene appreso direttamente dai dati. In questi sistemi non viene più progettata manualmente una rappresentazione dell'immagine: una rete neurale viene invece addestrata affinché produca vettori che massimizzino direttamente la capacità di riconoscere punti corrispondenti tra immagini differenti.
In una prospettiva più generale, il descrittore può essere interpretato come una rappresentazione latente dell'informazione contenuta nell'immagine. Modelli quali autoencoder, RBM (sezione 5.10.2) e CNN (sezione 5.10.5) possono essere visti come sistemi in grado di comprimere l'informazione osservata in uno spazio di dimensione ridotta preservando gli aspetti rilevanti per il compito da svolgere.
Questa evoluzione ha progressivamente ridotto la distinzione tra rilevamento, descrizione e associazione dei punti caratteristici, argomento che verrà approfondito nelle sezioni successive.