Stima congiunta di struttura e movimento

Anche nell'approccio 3D–2D i punti tridimensionali $\mathbf{x}_i$ non sono noti esattamente, ma sono stati ricavati attraverso una precedente procedura di triangolazione. Considerarli come dati privi di errore separa quindi artificialmente la stima della struttura da quella del movimento.

Un approccio più completo consiste nel considerare incognite sia la posa della camera sia la posizione tridimensionale dei punti, e nel minimizzare direttamente gli errori di riproiezione nelle immagini. Sotto l'ipotesi di errori gaussiani indipendenti e isotropi sulle coordinate immagine, tale minimizzazione corrisponde alla stima alla massima verosimiglianza:

\begin{displaymath}
\sum_i
\left(
\left\Vert
\mathbf{p}_1-\hat{\mathbf{p}}_1
\ri...
...\Vert
\mathbf{p}'_2-\hat{\mathbf{p}}'_2
\right\Vert^2
\right).
\end{displaymath} (10.104)

Le proiezioni stimate possono essere espresse come
\begin{align}
\hat{\mathbf{p}}_1 &=
\mathbf{K}_1\mathbf{R}_1
(\hat{\mathbf{x}}_i...
...}'_2 &=
\mathbf{K}_2\mathbf{R}_2
(\hat{\mathbf{x}}'_i-\mathbf{t}_2),
\end{align}
a cui va aggiunto il vincolo di equazione (10.102), mantenendo come incognita anche l'effettiva posizione tridimensionale dei punti $\hat{\mathbf{x}}_i$ e $\hat{\mathbf{x}}'_i$ nei due istanti di tempo.

In questo modo vengono stimati simultaneamente sia il movimento delle camere sia la posizione tridimensionale delle singole feature. La soluzione alla massima verosimiglianza richiede anche in questo caso la risoluzione di un problema non lineare, ma con un numero di incognite che cresce con il numero di punti considerati. Nel caso di una coppia stereo rettificata, la funzione costo può essere ulteriormente semplificata sfruttando la particolare geometria della configurazione.

Paolo medici
2026-10-06