Questo capitolo tratta in generale gli algoritmi che coinvolgono l'analisi di immagini provenienti da più di una camera con particolare attenzione al caso di visione stereoscopica.
L'obiettivo finale della visione multicamera non è soltanto la stima della profondità dei punti osservati, ma più in generale la ricostruzione di una rappresentazione tridimensionale della scena. Tale rappresentazione può assumere forme differenti, dalle tradizionali nuvole di punti e mesh fino alle più recenti rappresentazioni neurali e differenziabili.
Queste viste possono essere temporalmente coincidenti (per esempio nel caso della coppia di camere che formano una stereocamera) o possono osservare la scena in punti dello spazio e del tempo differenti come accade per esempio quando si processano immagini della stessa camera che si sposta nello spazio (motion stereo, structure from motion).
L'analisi stereoscopica può essere implementata principalmente attraverso due tecniche:
Condizione necessaria per ottenere una ricostruzione tridimensionale metrica della scena osservata, attraverso l'analisi di più immagini acquisite da punti di vista differenti, è la conoscenza dei parametri intrinseci delle camere coinvolte e la posa relativa tra di esse.
Se non si conosce la posa relativa questa può essere stimata attraverso l'analisi stessa delle immagini ma, come si vedrà in seguito, la distanza tra le camere sarà ricavata a meno di un fattore moltiplicativo e di conseguenza anche la ricostruzione tridimensionale sarà conosciuta a meno di tale fattore.
Se non si conoscono neanche i parametri intrinseci è comunque possibile mettere in relazione punti omologhi tra le due immagini e, grazie a questo processo, accelerare il confronto tra KeyPoint. In questo caso la scena può essere ricostruita solo a meno di una trasformazione proiettiva; per ottenere una ricostruzione metrica è necessario disporre di ulteriori informazioni di calibrazione.