[Paper Review, KR] SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation
Paper Information
Title: SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation
Authors: Yu Yuan, Tharindu Wickremasinghe, Zeeshan Nadir, Xijun Wang, Yiheng Chi, Stanley H. Chan
Venue: CVPR 2026
Link: [Paper], [Project], [GitHub]
Teaser Image
Introduction
โImage์ Video๋ ์ค์ ์ธ์(4D)์ 2D projection ์ด๋ค.โ ๋ผ๊ณ ๋ ผ๋ฌธ์ ์ ์๋ค์ ๋งํ๋ค.
๋ง์ ์ต๊ทผ ์ฐ๊ตฌ๋ค์ dynamic์ ๋ฎ์ ์ฐจ์์ latent space๋ฅผ ํตํด ํ์ตํ๋ฉฐ, ์ด๋ computational efficiency๋ผ๊ณ ๋งํ๋ค. ๊ทธ๋ฌ๋, ์ด๋ ํ๊ณ์ ์ ๊ฐ์ง๋ค:
- 4D ์์ฒด์ ์ ๋ณด๋ฅผ 2D๋ก ๋ฐ๊พธ๋ ๊ฒ์ ๊ฐ์ฅ ์ค์ํ 3D ๊ตฌ์กฐ ์ ๋ณด ์์ค๋ก ์ด์ด์ง๋ค.
- Camera pose๊ฐ ๋ณํ๋ ๊ฒ์ scene motion์ ๋ณต์ก๋๋ฅผ ๋์ธ๋ค.
์ด๋ก์ธํด model๋ค์ 2D visual pattern๋ง์ ํ์ตํ๊ธฐ ๋๋ฌธ์ 3D๋ ๋ฌผ๋ฆฌ์ ์ธ supervision์ด ์์ด 3D geometry์ ๋ฌผ๋ฆฌ์ dynamics๋ฅผ ํํํ๊ฑฐ๋ ํ์ ํ๊ธฐ ์ด๋ ต๋ค.
๊ทธ๋์ SeeU์ ์ ์๋ค์ pipeline์ ํฌ๊ฒ 2D \(\rightarrow\) 4D \(\rightarrow\) 2D ๋ฐฉ์์ผ๋ก ์ค๊ณํ์ฌ 4D dynamics๋ฅผ ์ฒ๋ฆฌํ๊ณ visual generation์ ํ๊ณ ์ ํ๋ค.
Method & Technical Details
ํด๋น ์ด๋ฏธ์ง๋ฅผ ๊ฐ๋จํ๊ฒ overview๋ก ๋ณด๋ฉด, (i) 2D \(\rightarrow\) 4D, (ii) Discrete 4D \(\rightarrow\) Continuous 4D, (iii) 4D \(\rightarrow\) 2D ๋ก ์งํ๋๋ค. ์์ธํ๊ฑด, ๊ณ์ ์ค๋ช ํ๊ฒ ๋ค.
๋จผ์ , Input์ ๋ณด์:
\[\{I_t \in \mathbb{R}^{H \times W \times 3}\}\]์ด๋ ๋์ ์ฅ๋ฉด์ ๋ํ monocular frame sequence๋ฅผ ์ฌ์ฉํ๋ค๋ ๊ฒ์ ์๋ฏธํ๋ค.
1st stage: 2D \(\rightarrow\) 4D
Shape-of-Motion(๊ฐ๋ ํ์)
ํด๋น ๋ ผ๋ฌธ์ ์ ์๋ค์ ICCV 2025 ๋ ผ๋ฌธ ์ค์์ โShape of Motion: 4D Reconstruction from a Single Videoโ๋ผ๋ ์ค์ ์ ํ๊ธฐ๋ฒ์ ๊ฐ์ ธ์์ ์ฌ์ฉํ๊ธฐ๋ก ํ๋ค. ์ด์ ๋ํ ์ด์ ๋ก,
- camera parallax(์นด๋ฉ๋ผ ์์ฐจ)๊ฐ ์์๋ ๋์์ด ๊ฐ๋ฅํ๋ฉฐ,
- static region๊ณผ trackable dynamic element๋ฅผ ๋ถ๋ฆฌํ ์ ์๊ธฐ ๋๋ฌธ
์ด๋ผ๊ณ ์ค๋ช ํ๋ค.
์ฌ๊ธฐ์ ๋ด๊ฐ ์์ overview figure๋ฅผ ๋งํ๋ฉด์ 2D \(\rightarrow\) 4D dynamic scene reconstruction ๋ถ๋ถ์ด ์ ์ผ ๋จผ์ ์งํ๋๋ค๊ณ ํ๋๋ฐ, ์ด ๋ถ๋ถ์์ ํด๋น ์ ํ ๊ธฐ๋ฒ์ด ์ฌ์ฉ๋๋ค.
์ถ๊ฐ์ ์ผ๋ก SoM ๋ ผ๋ฌธ์ ๋ฐ๋ก ๋ post์ ์ฌ๋ฆฌ๋๋ก ํ๊ฒ ๋ค.
์ผ๋จ ์ด ๋ ผ๋ฌธ์ ์ดํดํ๊ธฐ ์ํด์ SoM์ ์ค๋ช ํ๋ฉด, โmonocular ๋น๋์ค๋ก๋ถํฐ ์นด๋ฉ๋ผ ์์ง์๋ฟ ์๋๋ผ ์ฅ๋ฉด ๋ด๋ถ ๋ฌผ์ฒด๋ค์ 3D motion trajectory๊น์ง ๋ณต์ํ๋ 4D reconstruction ๋ฐฉ๋ฒโ์ด๋ค.
๋ณดํต ์ ์ ์ธ 3D reconstruction ๋ฐฉ๋ฒ์ด๋ผ๋ฉด:
\[\text{3D point} = (x,y,z)\]ํ๋๋ฅผ ๊ตฌํ๋ฉด ๋์ง๋ง, ์์ง์ด๋ ์ฅ๋ฉด ๊ฐ์ ๊ฒฝ์ฐ์๋
\[x_i(t) = (x_i(t), y_i(t), z_i(t))\]์ฒ๋ผ ์๊ฐ์ ๋ฐ๋ผ 3D ์์น๊ฐ ๋ณํ๋ ๊ฒ๋ ํํํด์ผ ํ๋ค.
๊ทธ๋ผ SeeU๊ฐ ์ด ๊ธฐ๋ฒ์ ์ฌ์ฉํด์ 4D reconstruction์ ์งํํ๋ ๋ฐฉ์์ ์ค๋ช ํ์๋ฉด,
\[I_0, I_1, ... , I_T\]๋ผ๋ monocular video ์ฌ๋ฌ frame์ ์ ๋ ฅ์ผ๋ก ๋ฐ์, MegaSaM์ด๋ผ๋ ๋ชจ๋ธ์ ์ด์ฉํด์ ๊ฐ frame์ camera intrinsics, camera extrinsics, depth map์ ์ป์ ์ ์๋ค. ๊ฐ frame t ๋ง๋ค
\[C_t = (K, R_t, t_t)\]์
\[D_t(u,v)\]๋ฅผ ์ป์ ์ ์๋ค. ์ฌ๊ธฐ์, u๋ v๋ ํฝ์ ์์น๋ฅผ 2D coordinates๋ก ํํํ ๊ฒ์ด๋ค.
์ด ์ ๋ณด๋ค์ ์ป์ผ๋ฉด \((u,v)\) ๋ฅผ 3D position์ธ \((X,Y,Z)\)๋ก liftํ ์ ์๋ค. ์ฆ, back-projectionํ ์ ์๋ค๋ ์๋ฆฌ๋ค. ๋ค์์ผ๋ก, Track-anything์ผ๋ก moving foreground mask๋ฅผ ์ป๋๋ค. static background์ dynamic foreground๋ฅผ ๋๋๋ค๋ ๋ป์ด๋ค.
๊ฐ์ฅ ์ค์ํ ๋ถ๋ถ์ผ๋ก, TAPIR ์ด๋ผ๋ ๋ชจ๋ธ์ ์ฌ์ฉํด์ ๋์ผํ point๋ฅผ ์ฌ๋ฌ frame์์ trackingํ๋ค.
๋ง์ฝ ์ด๋ pixel์ trackingํ๋ค๊ณ ํ๋ค๋ฉด,
\[p_0 = (320,320)\]์ด ๋ค์ frame์์
\[p_1 = (330, 250)\]์ ์์นํ๋ค๋ฉด ์ฐ๋ฆฌ๋ 2D trajectory๋ฅผ ์ป์ ์ ์๊ฒ ๋๋ค. ๊ทธ๋ฌ๋, ์ด๋ image plane์์์ 2D motion ์ด๋ค. ๊ทธ๋ ๋ค๋ฉด, 3D trajectory๋ฅผ ์ป๊ธฐ์ํด ์์์ camera pose ์ ๋ณด์ depth ์ ๋ณด๋ฅผ ์ฌ์ฉํด์ 2D trajectory๋ฅผ 3D trajectory๋ก ๋ณํํ๋ค. ์ฆ,
\[(u_t, v_t, D_t(u_t, v_t))\]๋ฅผ ์ด์ฉํด์ 3D point๋ก back-projectํ ์ ์๋ค.
\[p_t^{2D}\]๊ฐ
\[X_t^{3D}\]๊ฐ ๋๋๋ก ํ๋ค. ๊ทธ๋ฌ๋, ํ๋์ scene ์์ ๋ง์ Gaussian๋ค์ด ์์ํ ๋ฐ, ์ด ๋ชจ๋์ \(T_i(t)\)๋ผ๋ ๋ ๋ฆฝ์ ์ธ motion trajectory๋ฅผ ํ์ตํ๋ฉด ๋นํจ์จ์ ์ด๋ค. ๋ฐ๋ผ์ SoM์ motion basis๋ผ๋ concept๋ฅผ ๋ด๋ฏผ๋ค. ์ด motion basis๋ ์์ฒ, ์๋ง ๊ฐ์ point๋ค์ด ๊ฐ๊ฐ ์์ง์ด๋ ๊ฒ ์๋๋ผ ํ๋์ motion basis๋ฅผ ๊ณต์ ํ์ฌ ๋น์ทํ transformation์ ๊ณต์ ํ๋๋ก ํ๋ ๊ฒ์ด๋ค. ๋ฐ๋ผ์, ๊ฐ point๋ค์ด ๊ทธ๋ฃน์ ์ง์ด์ ๊ณตํต motion structure๋ฅผ ๊ฐ์ง๋ค๊ณ ์๊ฐํ๋ฉด ๋๋ค.
SoM์ ์ ์ฒด motion์ ๋ช ๊ฐ์ motion basis๋ก ์์ถํ๋ค. SeeU์์๋ ๋ค์๊ณผ ๊ฐ์ด ํํํ๋ค:
\[P_t^i = P_0^i + B(t)w_i\]์ฌ๊ธฐ์ \(P_t^i\)๋ Gaussian i์ ์๊ฐ t์์์ ์ํ๋ฅผ ๋งํ๋ค. ์ฆ, ํด๋น ์์ Gaussian i์ ์ด๊ธฐ์ํ์ shared motion basis์ ๊ฐ์ค์น์ ๊ณฑ์ ๋ํด์ ํน์ t ์๊ฐ๋์ Gaussian i์ ์ํ๋ฅผ ํํํ๋ ๊ฒ์ด๋ค. ์ฌ๊ธฐ์, ๊ฐ์ค์น๋ shared motion basis๋ฅผ ์ด๋ป๊ฒ ์กฐํฉํ ์ง ๊ฒฐ์ ํ๋ ์ญํ ์ ํ๋ค. ์ฆ, ๋ฌผ์ฒด๋ฅผ hardํ๊ฒ ๋ถ๋ฅํ ํ์ ์์ด ์ ์ ํ ์กฐํฉํ ์ ์๋ soft motion decomposition์ ๊ฐ๋ฅ์ผ ํ๋ค.
์ฌ๊ธฐ๊น์ง ๋ณด๋ฉด, ์ SoM์ด Shape-Of-Motion ์ด๋ผ๋ ์ด๋ฆ์ ๊ฐ์ง์ง ๋์ถฉ ์ ์ถ ๊ฐ๋ฅํ๋ค. ์๋ง์ point๊ฐ ๋ณต์กํ๊ฒ ์์ง์ด๋ ๊ฒ์ฒ๋ผ ๋ณด์ฌ๋ ์ค์ 3D motion์ few motion bases๋ก ์ค๋ช ๋๋ low-dimensional structure๋ฅผ ๊ฐ์ง๊ณ ์๋ค๊ณ ๋ณด๋ ๊ฒ์ด๋ค.
์ฌ๊ธฐ๊น์ง๊ฐ SoM์ ๊ธฐ๋ณธ ์ค๋ช ์ด๋ค. ๋ค์์ผ๋ก SeeU๊ฐ ์งํํ ๋ฐฉ์์ ์ค๋ช ํ๊ฒ ๋ค.
SoM์ผ๋ก ์ํํ๊ฒ๋๋ฉด ๊ธฐ๋ณธ์ ์ผ๋ก ๊ด์ธก๋ frame๋ง๋ค discreteํ motion state๋ฅผ ์ป๊ฒ ๋๋ค: ์๋ฅผ ๋ค์ด, ํ๋์ point๊ฐ \(t=0, 1, 2, 3\)์์
\[B_0, B_1, B_2, B_3\]๋ฅผ ์ป๊ฒ ๋๋ค๊ณ ํ์.
๊ทผ๋ฐ ์ฐ๋ฆฌ๋ \(t = 1.37, -0.5, 5.2\) ๋ฑ ๋ณด์ง ๋ชปํ ์์ ์๊ฐ์์์ motion๋ ์๊ณ ์ถ์ ์ ์๋ค. ์ด์๋ํด, SeeU๋ C4DD๋ผ๋ ๊ธฐ๋ฒ์ ๊ณ ์ํ๋ค.
C4DD ๊ธฐ๋ฒ์ ๊ธฐ์กด์ SoM์ด Discrete motion bases๋ก ๋ง๋ค์๋ค๋ฉด, ์ด๋ฅผ ์ฌ์ง๊ณผ ๊ฐ์ continuous B-spline์ผ๋ก ๋ง๋๋ ๊ฒ์ ์๋ฏธํ๋ค. B-spline์ ์ปดํจํฐ ๊ทธ๋ํฝ์ค์์ ๋ง์ด ์ฌ์ฉ๋๋ ์ฐ์ ํจ์ ์ค ํ๋๋ค. ์์๋๋ฉด ์ข๋ค.
๊ทธ๋ฌ๋ฉด, SeeU๋ ์ ์ฒด์ ์ผ๋ก ๋ณด์๋ฉด:
discrete 3D point trajectory์์ Procrustes analysis๋ก motion basis๋ฅผ ์ด๊ธฐํํ๊ณ photometric reconstruction error๋ก refineํ ๋ค์(SoM), ๊ทธ ๋ค์ SeeU๋ ์ด๊ฒ์ B-spline์ผ๋ก continuous function์ผ๋ก ๋ฐ๊พธ๊ฒ ๋๋ค.
์ ์๋ค์ ๋ํ ์๊ฐ์ ๋ฐ๋ผ ์ง์๋๋ canonical 3D Gaussian set \(\{g_i^0\}_{i=1}^N\)์ผ๋ก ํํํ๊ณ , ๋งค๊ฐ๋ณ์ํ๋ฅผ ์๋์ฒ๋ผ ํํํ๋ค:
\[g_i^0 = (\mu_i^0, R_i^0, s_i, o_i, c_i)\]์ฌ๊ธฐ์ \(\mu\)๋ canonical mean, \(R\)์ canonical orientation, \(s\)๋ scale์, \(o\)๋ opacity๋ฅผ, \(c\)๋ color์ ๋ํ๋ธ๋ค. ์ฐจ๋ก๋๋ก, ๊ฐ ๋งค๊ฐ๋ณ์๋ ํ๋์ ๊ฐ์ฐ์์์ ํํํ ๋ ๊ฐ์ฐ์์์ ์์น ํ๊ท , ํ์ , ํฌ๊ธฐ, ๋ถํฌ๋ช ๋, ์์ ์ญํ ์ ๋งก๋๋ค๊ณ ์๊ฐํ๋ฉด ๋๋ค(3D, 4D vision์์ 3D gaussian splatting ๊ธฐ๋ฒ์ด ์ฌ์ฉ๋๋ค๋ฉด ํ์๋ก ๋์ค๋ ๋งค๊ฐ๋ณ์๋ค์ด๋ ๊ผญ ์๊ณ ์๊ธฐ๋ฅผ ๋ฐ๋๋ค).
์ ์ด์ , gaussian์ด ํ๋ ์์ ํ๋ฆ์ ๋ฐ๋ผ ๋ณํํ๋ ๊ฒ๋ ํํํ ์ ์์ด์ผ ํ๋ค. per-frame rigid transformation ์ ํตํด์:
\[T_{0 \rightarrow t} = [R_{0 \rightarrow t} , t_{0 \rightarrow t}] \in SE(3)\]frame 0์์ t์ ๋ณํ๋ rotation๊ณผ translation matrix๋ฅผ ํตํด ํํ์ด ๊ฐ๋ฅํ๋ค:
\[\mu_i^t = R_{0 \rightarrow t}\mu_i^0 + t_{0 \rightarrow t},\; R_i^t = R_{0 \rightarrow t}R_i^0\]์ ๋ ฅ ํ๋ ์์ ๋ํด MegaSaM์ด๋ผ๋ ๋ชจ๋ธ๋ก ์นด๋ฉ๋ผ ๋ด๋ถ, ์ธ๋ถ ํ๋ผ๋ฏธํฐ, ๊ทธ๋ฆฌ๊ณ ํ๋ ์ ๋ณ depth๋ฅผ ์ถ์ ํ๊ณ , Track-anything ์ด๋ผ๋ ๋ชจ๋ธ๋ก dynamic foreground์ mask๋ฅผ ํ๋ํ๊ณ , TAPIR์ด๋ผ๋ ๋ชจ๋ธ๋ก 2D point track์ ์ถ์ถํ์ฌ ํ๋ ์ ์์ค์ camera pose ๋ฐ ์ ๊ฒฝ ๊ฐ์ฐ์์ ์์ฑ \(P\)๋ฅผ ์ถ๋ ฅํ๋ค.
2nd stage: Discrete 4D \(\rightarrow\) Continuous 4D
์ด์ Discrete 4D ๋ฅผ Continuous 4D๋ก ๋ฐ๊พธ๋ ๊ณผ์ ์ ๊ฑฐ์ณ์ผ ํ๋ค.
์ผ๋จ ์ฌ๊ธฐ์, ๋ ๊ฐ์ง ํํ์ ์ ์ํ๊ณ ์ ํ๋ค. ์์ 1 stage์์ ์ป์ camera pose์ ์ ๊ฒฝ ๊ฐ์ฐ์์์ ์์ฑ์ ์๋์ ๊ฐ์ด ํํํ๋ค:
\[C_t,\; P_t^i\]๊ทธ๋ฆฌ๊ณ ํด๋น ๋ ผ๋ฌธ์ ์ด๋ฅผ ์ง์ ํ๋ค:
- ํ๋์ scene์ ์๋ง ๊ฐ๊ฐ ๋๋ ๊ฐ๊ฐ์ ๊ฐ์ฐ์์๋ค์ ๊ฐ๋ณ์ ์ผ๋ก 3D trajectory๋ฅผ ํ์ต์ํค๋๊ฑด ๋งค์ฐ ๋นํจ์จ์ ์ด๋ค.
- ๋ณต์๋ trajectory๋ smooth ํด์ผํ๋ฉฐ, ๋ฌผ๋ฆฌ์ ์ผ๋ก ํ๋นํด์ผํ๋ค.
์ด ์ค์์ ์ฒซ ๋ฒ์งธ challenge๋ฅผ ํด๊ฒฐํ๊ธฐ ์ํด ๋ด๊ฐ ์์์ ์ค๋ช ํ Shape-Of-Motion ๊ธฐ๋ฒ์ ๊ฐ์ ธ์์ ํด๋น ๋ ผ๋ฌธ ์ ์๋ค์ ์ฌ์ฉํ๋ค. ๊ฐ๋จํ๊ฒ ๋งํ๋ฉด, ๊ฐ ๊ฐ์ฐ์์์ ๊ฐ๋ณ์ ์ผ๋ก motion์ ์ฃผ์ ํ๋ ๋ฐฉ์์ด ์๋๋ผ, ๊ฐ์ฐ์์๋ค์ด ๊ณต์ ํ๋ global motion basis๋ฅผ ์ฌ์ฉํ๊ฒ ํ๋ ๊ฒ์ด๋ค. ์ด ๋ฐฉ์์ ๋ ผ๋ฌธ์์๋ low-rank motion parameterization์ด๋ผ๊ณ ํํํ๋ค.
๊ทธ๋ฌ๋ฉด ์ฐ๋ฆฌ๋ foreground gaussian์ property๋ฅผ ๋ค์๊ณผ ๊ฐ์ด ํํํ ์ ์๋ค:
\[P_t^i = P_0^i + \underbrace{B(t)}_{\in \mathbb{R}^{m \times K}} \underbrace{w_i}_{\in \mathbb{R}^{K}}, \;\;\;\; P_0^i,\; P_t^i \in \mathbb{R}^m\]์ฌ๊ธฐ์ \(B(t)\)๋ global motion basis functions์ ์งํฉ์ด๊ณ , \(w_i\)๋ ๊ฐ์ฐ์์ i์ ๋ํ ์๊ฐ ๋ถ๋ณ ๊ณ์ ๋ฒกํฐ๋ค. ์ด๋ฅผ ํตํด, N๊ฐ์ ์๋ก ๋ค๋ฅธ ๊ถค์ ์ ์ง์ ํ์ตํ๋ ๋์ , ๊ณต์ ๋๋ K๊ฐ์ ๊ธฐ์ ํจ์ \(B(t)\)๋ฅผ ํตํด ๊ฐ ๊ฐ์ฐ์์์ ๋ช ๊ฐ์ coefficients ๋ง์ผ๋ก ์กฐ๋ฐํ๊ฒ ํํ๋๋ค.
์ด ์ด์ฐ์ ์ธ motion basis๋ค์ Procrustes analysis๋ฅผ ํตํด 3D ํฌ์ธํธ ๊ถค์ ๋ค๋ก๋ถํฐ ์ด๊ธฐํ๋ ํ์, photometric reconstruction error๋ฅผ ์ต์ํํจ์ผ๋ก์จ ์ ์ฐจ ์ ๊ตํด์ง๋ค(์์ธํ SoM์ ํ๋ฆ์ ์์ Shape Of Motion์ ๋๋ฌ ์์ธํ ์ดํด๋ณด๊ธฐ๋ฅผ ๋ฐ๋๋ค).
์ด๋ ๊ฒ ์ฒซ ๋ฒ์งธ challenge๋ฅผ ํตํด ํจ์จ์ ์ผ๋ก 3D trajectory๋ฅผ ๊ณ์ฐํ ์ ์๊ฒ ๋์๋ค.
๊ทธ๋ฌ๋ฉด ๋ ๋ฒ์งธ challenge๋ฅผ ํด๊ฒฐํ๊ธฐ ์ํด ๋ ผ๋ฌธ์ ์ ์๋ค์ continuous representation ํด์ผํ๋ค. ์ ์๋ค์ ์ด ๊ธฐ๋ฒ์ Continuous 4D Dynamics Model (C4DD)์ด๋ผ๊ณ ํํํ๋ค. ์ ์๋ค์ด ์ฌ์ฉํ๋ continuous function์ B-spline basis function์ด๋ค:
\[\hat{B}_t = \sum_{j=1}^M N_{j,d} (t) q_j\]์ฌ๊ธฐ์ \(N_{j,d}\)๊ฐ B-spline basis function ์ด๊ณ , \(q_j\)๋ motion basis๋ฅผ ์ํ ํ์ต ๊ฐ๋ฅํ control point๋ค. ์ด control point ๊ฐ์ \(M\)์ ๊ณก์ ์ ํํ capacity๋ฅผ ์ ์ดํ๋ค. \(M\)์ด ํด์๋ก ํ๋ถํ ์๊ฐ์ ํํ์ ๋ด์๋ผ ์ ์๋ ๋ฐ๋ฉด์, \(M\)์ด ์์ผ๋ฉด smoothness์ regularization ํจ๊ณผ๋ฅผ ๋ณด์ฌ์ค๋ค.
ํด๋น ์ด๋ฏธ์ง๋ฅผ ๋ณด๋ฉด ํ๋์ ์ ์์ ์ ์ด ์๋ ๊ฒ ๋ณด์ผ ๊ฒ์ด๋ค. ์ด ๊ณก์ ์ธ๋ถ์ ์๋ ๊ฐ์์ ์ ์ ์์ง์ด๋ฉด ํด๋น ์์ญ์ ๊ณก์ ์ ๋ชจ์์ ๋ณ๊ฒฝํ ์ ์๋ค. ๊ทธ๋ ๋ค๋ฉด ์ด ๋ ผ๋ฌธ์์ ์ค๋ช ํ๋ \(M\)์ ๊ฐ์๋ ์ค์ ๊ณก์ ์ ๋ชจ์์ ๊ฒฐ์ ํ๋ ๊ณก์ ์ธ๋ถ์ ์ ์ฆ, control point์ ๊ฐ์๋ฅผ ๋งํ๋ค๊ณ ๋ณด๋ฉด ๋๋ค. ์ด๋ ์ปดํจํฐ ๊ทธ๋ํฝ์ค์์ ์์ฃผ ๋ฑ์ฅํ๋ ๊ฐ๋ ์ด๋ค.
ํ์ต ๋์, shared motion basis์ B-spline control points์ Camera trajectory์ B-spline Control points๋ ์ด objective function์ ํตํด optimization ๋๋ค:
\[L_{total} = L_{data} + \lambda_{phys} L_{phys}\]data term์ C4DD๊ฐ ์ถ์ ํ motion basis์ ์ฒซ ๋ฒ์งธ challenge์์ ํ๋ณดํ discrete ๊ด์ธก๊ฐ ์ฌ์ด์ ์ผ๊ด์ฑ์ ๊ฐ์ ํ๋ค:
\[L_{data} = \sum_{t \in \mathcal{T}_{obs}} \lVert \hat{B}_t - B_{obs}^t \rVert_2^2\]์ฌ๊ธฐ์ \(B_{obs}^t\)๋ t์์ ๊ด์ธก๋ discrete motion basis(Procrustes analysis๋ฅผ ํตํด ์ถ์ถํ๊ณ photometric loss๋ฅผ ํตํด refine๋)๋ฅผ ๋ํ๋ด๊ณ , \(\hat{B}_t\)์ B-spline ๋งค๊ฐ๋ณ์ํ๋ก๋ถํฐ ํ๊ฐ๋ C4DD์ ์์ธก๊ฐ์ด๋ค. \(\mathcal{T}_{obs}\)๋ ๊ด์ธก๋ ์๊ฐ๋๋ก ๋์ผ๋ก ์ค์ ๋ก ๊ด์ฐฐํ ํ๋ ์๋ค์ ์ค์ ์์ ๋ค์ด๋ค.
physics term์ ํด๋น ์์์ ๊ฐ ํญ์ ๊ฐ์๋๋ฅผ ์ค์ด๋ ์ญํ ์ ์ํํ๋ค:
\[L_{phys} = \mathbb{E}_{\tau_{ex}(t)} [\lVert \ddot{MB}_{trans}(t) \rVert_2^2 + \lVert \ddot{CAM}_{trans}(t) \rVert_2^2 + \mathbb{I}_{rot} \lVert \ddot{CAM}_{rot}(t) \rVert_2^2]\]์ฌ๊ธฐ์ \(\ddot{MB}_{trans}(t)\)์ \(\ddot{CAM}_{trans}(t)\)๋ ๊ฐ๊ฐ motion basis์ camera trajectory์์ translational component์ ๋ํ 2์ฐจ ๋ฏธ๋ถ(๊ฐ์๋)๋ฅผ ์ต์ํํ๋๋ก ํ๋ค. ์ฆ, ๋ฑ์๋๋ smoothํ๊ฒ ์์ง์ด๋ ๊ฒ์ผ๋ก ๊ฐ์ ํ๋ค. ๊ทธ๋ฆฌ๊ณ , \(\ddot{CAM}_{rot}(t)\)๋ camera trajectory์์ ํ์ ๊ฐ์๋๋ฅผ ์ต์ํํ๋๋ก ํ๋ ๊ฒ์ด๋ฉฐ, \(\mathcal{I}_{rot} \in \{0,1\}\)์ ๊ฒฝ์ฐ, ์นด๋ฉ๋ผ ํ์ ์ด ๊ฑฐ์ ์๋ ๋จ์ํ scene์์ ์ด ์ ์ฝ์ ๋ ์ ์๋๋กํ๋ ์ฅ์น๋ค.
์ถ๊ฐ์ ์ผ๋ก \(\mathbb{E}_{\tau_{ex}(t)} [...]\) ๋ ์ธ์ฝ ๊ฐ์ค์น ๊ธฐ๋๊ฐ์ผ๋ก, ๋น๋์ค๋ก ์ค์ ๋ก ๊ด์ธกํ์ง ์์ ๊ณผ๊ฑฐ ํน์ ๋ฏธ๋ ์์ญ์ ์๊ฐ๋์ธ ์ธ์ฝ์์ \(\tau_{ex}(t)\)์ธ ๊ฐ์ค์น ํจ์๋ฅผ ํตํด ์๊ฐ์ ์ผ๋ก ๋ฉ์ด์ง์๋ก ๊ฐ์ค์น๊ฐ ํจ์ฌ ๋ ๋ฌด๊ฒ๊ฒ ์ปค์ง๋๋ก ์ค๊ณ๋์ด์๋ ๊ฒ์ ๋งํ๋ค. ์ฌ๊ธฐ์ ๊ธฐ๋๊ฐ์ธ ๊ฐ์คํ๊ท ์ฐ์ฐ์ ํตํด ์งํํ๋ค.
3rd stage: 4D \(\rightarrow\) 2D
์ด๋ ๊ฒ 2 stage๊ฐ ๋๋ ํ, 2D video๋ก projectionํ๋ ๊ณผ์ ์ ๊ฑฐ์ณ์ผ ํ๋ค.
์ฌ๊ธฐ์, scaffold video๋ occlusion region์ด ์กด์ฌํ ์ ์์ผ๋ฉฐ, ํฌ์๋ ๊ฐ์ฐ์์๋ค์ด ๋ฎ์ ์ ๋ขฐ๋๋ฅผ ๋ณด์ด๊ฑฐ๋ ๋ฌผ์ฒด ๊ฒฝ๊ณ ๋ฐ ๊ฐ๋ ค์ง ๋ฑ์ด ๋ํ๋ ์ ์๋ค.
์ด๋ฅผ ํด๊ฒฐํ๊ธฐ ์ํด ํด๋น ๋ ผ๋ฌธ์ ๋น๋์ค ์์ฑ ๋ชจ๋ธ์ spatial-temporal in-context ๋ฅ๋ ฅ์ ํ์ฉํด์ ํ๋ ์์ ๋ณต์ํ๋ค. VLM์ผ๋ก๋ถํฐ ์ป์ด๋ธ ๊ตฌ์กฐํ๋ prompt(scene์ ๋ํ caption), 2 stage์์ ๋ง๋ 4D scene์ 2D ๋ก projectionํ ํ๋ ์๋ค, ๊ทธ๋ฆฌ๊ณ ๊ทธ ํ๋ ์๋ค์์ occlusion์ด ์ผ์ด๋ ์์ญ์ ๋ํ inpainting mask๋ค. Context Encoder๋ ์ด๋ฐ ์ ๋ณด๋ค์ ๋ง์ context embedding์ ์์ฑํ๊ณ , ์ด๋ฅผ pretrained ๋ video generator์ ์ฃผ์ ํ๋ค. ์ด๋ฅผ ํตํด Unseen frame์ ๋ํ ๊ฒฐ๊ณผ๋ฌผ์ ๋์ถํ๋ค.
์ด์ figure 3๋ฅผ ๋ณด๋ฉด์ ๋ช ์พํ ์ดํด๊ฐ ๊ฐ๋ฅํ๋ค. ์ด ๋ ผ๋ฌธ์ ๊ฒฐ๊ตญ
sparseํ ๋น๋์ค ์ ๋ ฅ์ ๋ฐ์ 4D scene์ผ๋ก reconstruction ํ์ฌ physical ๊ทธ๋ฆฌ๊ณ , 3D geometry๋ฅผ consistent๋ฅผ ์ ์งํ๋ ์ํ์์ video generator๊ฐ ๊ณผ๊ฑฐ ํน์ ๋ฏธ๋ ํน์ sparse ๋น๋์ค frame์ ์ ์ธํ ์ฌ๋ฌ ์์ ์์์ frame์ ์์ฑํ ์ ์๋๋ก ๋์์ฃผ๋ pipeline์ ๋ง๋ ๊ฒ
์ฌ์ค ๋ ผ๋ฌธ์๋ โ2. Why model Continuous Dynamics in 4Dโ๋ผ๋ ์น์ ์ด method ์น์ ์ ์ ์กด์ฌํ๋๋ฐ, ์ด ๋ฆฌ๋ทฐ๋ฅผ ์ฐ๋ ์ ์๋ method๋ฅผ ์ฝ๊ณ ํด๋น ์น์ ์ ์ฝ์ผ๋ฉด ์ดํด๊ฐ ๋ ์ ๋๋ค.
- ๊ธฐ์กด์ ๋น๋์ค ์์ฑ๋ชจ๋ธ๋ค์ 3D ๊ณต๊ฐ ํํ์ด ์๊ธฐ ๋๋ฌธ์, ์นด๋ฉ๋ผ ์์ ์ด ๋ฐ๋๊ฑฐ๋ ๋ฌผ์ฒด๊ฐ ๋ฌผ์ฒด ๋ค๋ก ์จ๋ occlusion ํ์์ด ๋ฐ์ํ๋ฉด ํํ๊ฐ ์ด์ํด์ง๊ฑฐ๋ ์ ์ฒด๊ฐ์ด ๊นจ์ง๋ค. ์ถ๊ฐ์ ์ผ๋ก, video ์์ฑ ๋ชจ๋ธ๋ค์ ์ด์ ํ๋ ์์ ์๋ ํฝ์ ๋ค์ ์จ์ ํ๊ฒ ์ ์ฅํ์ง ๋ชปํ๋ค. ๊ทธ๋ฐ๋ฐ 3D ๊ณต๊ฐ์ ๋์ธ ๊ฐ์ฐ์์๋ค์ 3D ๊ณต๊ฐ ํํ ์๋ ๊ณ์ ์ ์ง๋๋ฏ๋ก ์ต์ ํ๋ฅผ ์ํ๋ฉด ์ฌ๋ฌ ์นด๋ฉ๋ผ ์์ ์์๋ ์ผ์ ํ geometry๋ฅผ ๊ฐ์ง ์ ์๋ค(์ ๋ง์ novel view synthetic ๋ฐฉ์์ video generation ๋ ผ๋ฌธ๋ค์ด point cloud๋ 3DGS๋ฅผ ์ฌ์ฉํ๋์ง ์ด๋ ดํ์ด ์ดํด๊ฐ ๊ฐ๋ค.).
- 2D ํ๋ฉด ์์์ ์์ง์์ ์ถ์ ํ๋ฉด ์๊ทผ๋ฒ๊ณผ ์นด๋ฉ๋ผ ํ๋ค๋ฆผ ๋๋ฌธ์ ๊ถค์ ์ด ๋งค์ฐ ๋ณต์กํ์ง๋ง, ์๋ 4D(3D) coordinates์์ ๋ฐ๋ผ๋ณด๋ฉด ๋ฌผ๋ฆฌ ๋ฒ์น ๋๋ฌธ์ ์์ง์์ด ํจ์ฌ ๋จ์ํ๊ณ ๊ท์น์ ์ด๋ค. ๊ทธ๋ฆฌ๊ณ C4DD ๊ธฐ๋ฒ์ ์ฌ์ฉํ๋ฉด ์ฐ์์ ์ธ ๊ณผ์ ์ผ๋ก ์ด๋ฅผ ํํํ ์ ์์ด ์์์ ์์ ์ ์์ฐ์ค๋ฝ๊ฒ ์ฑ์ธ ์ ์๋ค.
- ์นด๋ฉ๋ผ์ ์์ง์ ๊ทธ๋ฆฌ๊ณ ๊ฐ์ฒด์ ์์ง์ ๋ฑ์ ๋ณํ๊ฐ 2D ๋น๋์ค์์๋ ๋ถ๋ฆฌ๋์ด ์์ง ์๊ณ ์ข ์์ ์ด๊ธฐ ๋๋ฌธ์ ์์ ์ ์ธ ๊ธฐ์ค ์ขํ๊ณ๊ฐ ์๋ค. ๊ทธ๋ ๊ธฐ ๋๋ฌธ์ ํ์ต์ด ์ด๋ ค์ด๋ฐ, SeeU์ ๊ฒฝ์ฐ์๋ ๊น์ด ์ถ์ ๊ณผ ํธ๋ํน ๊ธฐ๋ฒ์ ํ์ฉํด์ Background์ foreground๋ก ๋๋๊ณ , ์นด๋ฉ๋ผ ํฌ์ฆ๋ฅผ ๋ฌผ๋ฆฌ์ ์ผ๋ก ๋ถ๋ฆฌํ๋ค.
์ด๋ ๊ธฐ ๋๋ฌธ์ SeeU๋ ํ์ดํ๋ผ์ธ์ ์์ ๊ฐ์ด ์ค๊ณํ๋ค๊ณ ๋ณด๋ฉด ๋๋ค.
Experiments
Datasets & Training details
๋ ผ๋ฌธ์ ์ ์๋ค์ ์์ฒด์ ์ผ๋ก ์ดฌ์ํ ์์ ๋ฐ ์คํ ๊ณต๊ฐ ์์ค์์ ์์งํ 45๊ฐ์ ๋์ ์ธ ์ฅ๋ฉด์ ํตํด ํ๊ฐ๋ฅผ ์งํํ๋ค:
- ๋น๋์ค ํฌ์ธํธ ์ถ์ ๋ฒค์น๋งํฌ์ธ TAP-vid
- ๊ณ ํ๋ ์ rate ๋ฐ์ดํฐ์ ์ธ I2-2000FPS
- robotics video set์ธ AgiBot World
- Animal Kingdom dataset
ํด๋น ๊ณต๊ฐ ์์ค ๋ฐ์ดํฐ์ ๋ค์ ํ์ฉํ๋ค.
์ด๋ค์ NVIDIA A100 (80GB) GPU 1๊ฐ๋ฅผ ์ฌ์ฉํ๋ฉฐ, Adam optimizer๋ฅผ ์ฌ์ฉํด ์ต์ ํํ๋ค. ์ด์ธ์๋ 1st stage, 2nd stage, 3rd stage์ ๊ด๋ จํ training detail๋ค์ ์ง์ ๋ ผ๋ฌธ์ ํ์ธํ๊ธธ ๋ฐ๋๋ค.
Results
Temporally Unseen Generation ์ ํ๊ฐํ๊ธฐ ์ํด์ Table 1์ ๋ณด๋ ๊ฒ๊ณผ ๊ฐ์ด Past frame, Dynamic Frame Interpolation(frame๊ณผ frame ์ฌ์ด), Future frame์ inferenceํ๊ณ PSNR, SSIM, LPIPS, C-LPIPS ์งํ๋ค์ ์ฌ์ฉํ์ฌ ํ๊ฐํ์๋ค. ๊ทธ๋ฆฌ๊ณ , past, dynamic, future์ ๋ชจ๋ ์ข ํฉ์ ์ผ๋ก inferenceํ๋ ๋ชจ๋ธ์ด ์์ด dynamic, future๋ฅผ ๊ฐ๊ฐ inference ํ๋ ๋ชจ๋ธ InterpAny, Wan2.2, Cosmos๋ฅผ ๊ธฐ์กด SOTA ๋ชจ๋ธ๋ก์จ ํ๊ฐํ๋ค.
๋ํ, SoM๊ณผ VACE๋ ๊ฐ๊ฐ ๊ธฐ์กด ์ฐ๊ตฌ๋ค์ ๊ธฐ๋ฒ์ด์ง๋ง, ๊ณผ๊ฑฐ frame, frame interpolation, ๋ฏธ๋ frame์ ์ฒ๋ฆฌํ ์ ์๋๋ก ํ์ฅํ์ฌ ์งํํ์๋ค. VACE์ ๊ฒฝ์ฐ์๋ Unseen ํ๋ ์๋ค์ ๋ง์คํน ์ฒ๋ฆฌํ์ฌ ์ ์ฒด ์๊ฐ ๋ฒ์๋ฅผ ๋ณต์ํ ์ ์๋๋ก ํ์ฅํ๊ณ , SoM์ ๊ฒฝ์ฐ์๋ motion ์ถ์ ์ linear interpolation์ผ๋ก linear extrapolation ๊ธฐ๋ฒ์ ๊ฒฐํฉํด์ ์ ์ฒด ์๊ฐ ๋ฒ์๋ฅผ ๋ณต์ํ ์ ์๋๋ก ์ต์ง๋ก ํ์ฅํ์๋ค.
SeeU๋ ํจ์ฌ ๋ ๊ฐ๋ ฅํ ์ฐ์ ์๊ฐ ์ญํ ์ธ์ง(continuous-time dynamics awareness)์ 3D ๊ธฐํํ์ ํด์ ๋ฅ๋ ฅ์ ๋ณด์ฌ์ฃผ์๋ค.
๋ํ figure 4๋ฅผ ๋ณด๊ธฐ์๋ SeeU๋ ํจ์ฌ ๋ ๊ฐ๋ ฅํ ์ฐ์ ์๊ฐ ์ญํ ์ธ์ง(continuous-time dynamics awareness)์ 3D ๊ธฐํํ์ ํด์ ๋ฅ๋ ฅ์ ๋ณด์ฌ์ฃผ์๋ค.
์ถ๊ฐ์ ์ผ๋ก figure 5๋ฅผ ๋ณด๋ฉด ์๋ก์ด insight๋ฅผ ํ์ธํ ์ ์๋๋ฐ, ๊ณผ๊ฑฐ 50%, ๋ฏธ๋ 50% ์์ญ ์ฆ, ์ธ์ฝ๋ ์์ญ์์ ์๊ฐ์ ๊ฑฐ๋ฆฌ๊ฐ ๋ฉ์ด์ง์๋ฐ๋ผ ์ ํ๋๊ฐ ์ ํ์ ์ผ๋ก ๊ฐ์ํ๋ ๊ฒ์ ํ์ธํ ์ ์์๋ค.
Spatially Unseen Generation์ ํ๊ฐํ๊ธฐ ์ํด Table 2์ ๋ณด๋ ๊ฒ๊ณผ ๊ฐ์ด ์ฌ๋ฌ ์นด๋ฉ๋ผ ์ ์ด ๋ฐฉ์์ ๊ฐ๊ฐ ์นด๋ฉ๋ผ ์ ์ด๊ฐ ๊ฐ๋ฅํ ๋น๋์ค ๋ชจ๋ธ์ธ GCD, ReCamMaster ๊ณผ ๋น๊ตํ์๋ค.
table 2๋ฅผ ๋ณด์์ ๋, SeeU๊ฐ ๋ชจ๋ ๋ฒ ์ด์ค๋ผ์ธ๋ณด๋ค ๋ ๋์ ๊ธฐํํ์ ์ ํ๋(EE ๋ฐ EIR)์ ์ฅ๋ฉด ์ผ๊ด์ฑ(CLIP-V)์ ๋ฌ์ฑํจ์ ๋ณด์ฌ์ฃผ๋ฉฐ, Figure 6๋ฅผ ๋ณด์์ ๋ SeeU๊ฐ ๋ ํ๋ถํ ์ฅ๋ฉด ๋ํ ์ผ์ ๋ ๋๋งํ ์ ์๋ ๋ฅ๋ ฅ์ ๊ฐ์ถ๊ณ ์์์ ๋ณด์ฌ์ค๋ค.
Table 3๋ฅผ ๋ณด๋ค์ํผ, ablation study๋ 3๊ฐ์ ๋ฐฉํฅ์ผ๋ก ์งํ๋์๋ค:
- B-spline parameterization ์ plain MLP layers๋ก ๋ฐ๊พธ๋ ๊ฒ
- physics loss weight \(\lambda_{phys}\) ๋ฅผ 0์ผ๋ก ๋ฐ๊พธ์ด ํด๋น physics loss term์ ํจ๊ณผ ์ ๊ฑฐ
- sparseํ frame ์๋ฅผ 5, 10, 15, 20 ๊ฐ๋ก ์ฌ๋ฌ input frame ์๋ฅผ ์กฐ์ ํ์ฌ ์คํ
Table 3๋ฅผ ๋ณด๋ค์ํผ, ๋จผ์ continuous dynamics๋ฅผ ์ํ B-spline์ inductive bias๋ smoothness์ physical consistency ์ธก๋ฉด์์ ์ฅ์ ์ ๊ฐ์ง์ ๋ณผ ์ ์๋ค. ๊ทธ๋ฆฌ๊ณ , physics loss term๋ continuous dynamics๋ฅผ ์์ ํํ๋๋ฐ ๋์์ ์ฃผ๋ ๊ฒ์ผ๋ก ๋ณด์ด๋ฉฐ, input frame ์๊ฐ ์ ์ sparse ํด์ง๋๋ผ๋ robustํ๊ฒ ์ฑ๋ฅ์ ์ ์งํ๋ ๊ฒ์ด ๋ณด์ธ๋ค(์ง๊ธ ์ด ๋ ผ๋ฌธ์ ๋ฆฌ๋ทฐํ๋ ๋ด๊ฐ ๋ณด๊ธฐ์๋ table 1์ ๋ชจ๋ธ๋ค์ input condition์ ๋น๊ตํด๋ด์ผ ์ ํํ frame์ ๋ํ ์ฅ์ ์ด ์๋์ง ํ์ธ์ด ๊ฐ๋ฅํ ๊ฒ ๊ฐ๋ค).
Contributions
- 2D Projection ์ด๋ฏธ์ง๋ก๋ถํฐ ์ฐ์์ ์ธ 4D Dynamics์ ์ง์ ํ์ตํ์ฌ ๋ณด์ด์ง ์๋ ์๊ณต๊ฐ ์์ญ(๊ณผ๊ฑฐ/๋ฏธ๋/์๋ก์ด ์์ )์ ์์ฑํ๊ณ ๋น๋์ค๋ฅผ ์ ๊ตํ๊ฒ ํธ์งํ ์ ์๋ ์๋ก์ด ๊ฐ๋ ์ธ โSeeUโ๋ฅผ ์ ์ํ๋ค.
- 2D ์ ๋ ฅ ๋ฐ์ดํฐ๋ก๋ถํฐ 4D ๋ฌผ๋ฆฌ ์ญํ์ ๋ช ์์ ์ผ๋ก ํ์ตํ ๋ค ๋ค์ ๊ณ ํ์ง 2D ๋น๋์ค ์ฝํ ์ธ ๋ฅผ ์ฌํฌ์ํด ๋ด๋ ํ๊ณ ์ต์ด์ โ2D \(\rightarrow\) 4D \(\rightarrow\) 2Dโ ํ์ต ํ๋ ์์ํฌ ํจ๋ฌ๋ค์์ ์ ๋ฆฝํ๋ค.
Limitations & Future works
ํด๋น ๋ ผ๋ฌธ์ input ๋ฐ์ดํฐ๋ค์ ์ ๊ฒฝ์ ์์ง์๊ณผ camera pose์ ๋ณํ๊ฐ smoothํ๊ณ ๋ช ํํ ๊ฒ๋ค์ ๊ธฐ์ค์ผ๋ก ์งํํ์๋ค. ์ฆ, ์ ๊ฒฝ์ด ๋๊ตฌ ์ ์๋ค์ฒ๋ผ ๋งค ์๊ฐ ๋น ๋ฅด๊ฒ ๋ณํํ๊ฑฐ๋ ๋ณ์น์ ์ด์ง ์์ผ๋ฉฐ camera ์์ ์ ๋ณํ๊ฐ ๊ทน์ ์ด์ง ์๊ธฐ ๋๋ฌธ์ ์์ ํ out-of-distribution์์๋ ๋ฌธ์ ๊ฐ ์์ ๊ฒ์ด๋ผ๊ณ ๋ณธ๋ค.