Paper Information
Title: SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation
Authors: Yu Yuan, Tharindu Wickremasinghe, Zeeshan Nadir, Xijun Wang, Yiheng Chi, Stanley H. Chan
Venue: CVPR 2026
Link: [Paper], [Project], [GitHub]

Teaser Image

Introduction

โ€œImage์™€ Video๋Š” ์‹ค์ œ ์„ธ์ƒ(4D)์˜ 2D projection ์ด๋‹ค.โ€ ๋ผ๊ณ  ๋…ผ๋ฌธ์˜ ์ €์ž๋“ค์€ ๋งํ•œ๋‹ค.

๋งŽ์€ ์ตœ๊ทผ ์—ฐ๊ตฌ๋“ค์€ dynamic์„ ๋‚ฎ์€ ์ฐจ์›์˜ latent space๋ฅผ ํ†ตํ•ด ํ•™์Šตํ•˜๋ฉฐ, ์ด๋Š” computational efficiency๋ผ๊ณ  ๋งํ•œ๋‹ค. ๊ทธ๋Ÿฌ๋‚˜, ์ด๋Š” ํ•œ๊ณ„์ ์„ ๊ฐ€์ง„๋‹ค:

  1. 4D ์ž์ฒด์˜ ์ •๋ณด๋ฅผ 2D๋กœ ๋ฐ”๊พธ๋Š” ๊ฒƒ์€ ๊ฐ€์žฅ ์ค‘์š”ํ•œ 3D ๊ตฌ์กฐ ์ •๋ณด ์†์‹ค๋กœ ์ด์–ด์ง„๋‹ค.
  2. Camera pose๊ฐ€ ๋ณ€ํ•˜๋Š” ๊ฒƒ์€ scene motion์˜ ๋ณต์žก๋„๋ฅผ ๋†’์ธ๋‹ค.

์ด๋กœ์ธํ•ด model๋“ค์€ 2D visual pattern๋งŒ์„ ํ•™์Šตํ•˜๊ธฐ ๋•Œ๋ฌธ์— 3D๋‚˜ ๋ฌผ๋ฆฌ์ ์ธ supervision์ด ์—†์–ด 3D geometry์™€ ๋ฌผ๋ฆฌ์  dynamics๋ฅผ ํ‘œํ˜„ํ•˜๊ฑฐ๋‚˜ ํŒŒ์•…ํ•˜๊ธฐ ์–ด๋ ต๋‹ค.

๊ทธ๋ž˜์„œ SeeU์˜ ์ €์ž๋“ค์€ pipeline์„ ํฌ๊ฒŒ 2D \(\rightarrow\) 4D \(\rightarrow\) 2D ๋ฐฉ์‹์œผ๋กœ ์„ค๊ณ„ํ•˜์—ฌ 4D dynamics๋ฅผ ์ฒ˜๋ฆฌํ•˜๊ณ  visual generation์„ ํ•˜๊ณ ์ž ํ•œ๋‹ค.

Method & Technical Details

ํ•ด๋‹น ์ด๋ฏธ์ง€๋ฅผ ๊ฐ„๋‹จํ•˜๊ฒŒ overview๋กœ ๋ณด๋ฉด, (i) 2D \(\rightarrow\) 4D, (ii) Discrete 4D \(\rightarrow\) Continuous 4D, (iii) 4D \(\rightarrow\) 2D ๋กœ ์ง„ํ–‰๋œ๋‹ค. ์ž์„ธํ•œ๊ฑด, ๊ณ„์† ์„ค๋ช…ํ•˜๊ฒ ๋‹ค.

๋จผ์ €, Input์„ ๋ณด์ž:

\[\{I_t \in \mathbb{R}^{H \times W \times 3}\}\]

์ด๋Š” ๋™์  ์žฅ๋ฉด์— ๋Œ€ํ•œ monocular frame sequence๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค๋Š” ๊ฒƒ์„ ์˜๋ฏธํ•œ๋‹ค.

1st stage: 2D \(\rightarrow\) 4D

Shape-of-Motion(๊ฐœ๋… ํ•„์ˆ˜)

ํ•ด๋‹น ๋…ผ๋ฌธ์˜ ์ €์ž๋“ค์€ ICCV 2025 ๋…ผ๋ฌธ ์ค‘์—์„œ โ€œShape of Motion: 4D Reconstruction from a Single Videoโ€๋ผ๋Š” ์‹ค์ œ ์„ ํ–‰๊ธฐ๋ฒ•์„ ๊ฐ€์ ธ์™€์„œ ์‚ฌ์šฉํ•˜๊ธฐ๋กœ ํ•œ๋‹ค. ์ด์— ๋Œ€ํ•œ ์ด์œ ๋กœ,

  1. camera parallax(์นด๋ฉ”๋ผ ์‹œ์ฐจ)๊ฐ€ ์ž‘์•„๋„ ๋™์ž‘์ด ๊ฐ€๋Šฅํ•˜๋ฉฐ,
  2. static region๊ณผ trackable dynamic element๋ฅผ ๋ถ„๋ฆฌํ•  ์ˆ˜ ์žˆ๊ธฐ ๋•Œ๋ฌธ

์ด๋ผ๊ณ  ์„ค๋ช…ํ•œ๋‹ค.

์—ฌ๊ธฐ์„œ ๋‚ด๊ฐ€ ์•ž์„œ overview figure๋ฅผ ๋งํ•˜๋ฉด์„œ 2D \(\rightarrow\) 4D dynamic scene reconstruction ๋ถ€๋ถ„์ด ์ œ์ผ ๋จผ์ € ์ง„ํ–‰๋œ๋‹ค๊ณ  ํ–ˆ๋Š”๋ฐ, ์ด ๋ถ€๋ถ„์—์„œ ํ•ด๋‹น ์„ ํ–‰ ๊ธฐ๋ฒ•์ด ์‚ฌ์šฉ๋œ๋‹ค.

์ถ”๊ฐ€์ ์œผ๋กœ SoM ๋…ผ๋ฌธ์€ ๋”ฐ๋กœ ๋˜ post์— ์˜ฌ๋ฆฌ๋„๋ก ํ•˜๊ฒ ๋‹ค.

์ผ๋‹จ ์ด ๋…ผ๋ฌธ์„ ์ดํ•ดํ•˜๊ธฐ ์œ„ํ•ด์„œ SoM์„ ์„ค๋ช…ํ•˜๋ฉด, โ€œmonocular ๋น„๋””์˜ค๋กœ๋ถ€ํ„ฐ ์นด๋ฉ”๋ผ ์›€์ง์ž„๋ฟ ์•„๋‹ˆ๋ผ ์žฅ๋ฉด ๋‚ด๋ถ€ ๋ฌผ์ฒด๋“ค์˜ 3D motion trajectory๊นŒ์ง€ ๋ณต์›ํ•˜๋Š” 4D reconstruction ๋ฐฉ๋ฒ•โ€์ด๋‹ค.

๋ณดํ†ต ์ •์ ์ธ 3D reconstruction ๋ฐฉ๋ฒ•์ด๋ผ๋ฉด:

\[\text{3D point} = (x,y,z)\]

ํ•˜๋‚˜๋ฅผ ๊ตฌํ•˜๋ฉด ๋˜์ง€๋งŒ, ์›€์ง์ด๋Š” ์žฅ๋ฉด ๊ฐ™์€ ๊ฒฝ์šฐ์—๋Š”

\[x_i(t) = (x_i(t), y_i(t), z_i(t))\]

์ฒ˜๋Ÿผ ์‹œ๊ฐ„์— ๋”ฐ๋ผ 3D ์œ„์น˜๊ฐ€ ๋ณ€ํ•˜๋Š” ๊ฒƒ๋„ ํ‘œํ˜„ํ•ด์•ผ ํ•œ๋‹ค.

๊ทธ๋Ÿผ SeeU๊ฐ€ ์ด ๊ธฐ๋ฒ•์„ ์‚ฌ์šฉํ•ด์„œ 4D reconstruction์„ ์ง„ํ–‰ํ•˜๋Š” ๋ฐฉ์‹์„ ์„ค๋ช…ํ•˜์ž๋ฉด,

\[I_0, I_1, ... , I_T\]

๋ผ๋Š” monocular video ์—ฌ๋Ÿฌ frame์„ ์ž…๋ ฅ์œผ๋กœ ๋ฐ›์•„, MegaSaM์ด๋ผ๋Š” ๋ชจ๋ธ์„ ์ด์šฉํ•ด์„œ ๊ฐ frame์˜ camera intrinsics, camera extrinsics, depth map์„ ์–ป์„ ์ˆ˜ ์žˆ๋‹ค. ๊ฐ frame t ๋งˆ๋‹ค

\[C_t = (K, R_t, t_t)\]

์™€

\[D_t(u,v)\]

๋ฅผ ์–ป์„ ์ˆ˜ ์žˆ๋‹ค. ์—ฌ๊ธฐ์„œ, u๋ž‘ v๋Š” ํ”ฝ์…€ ์œ„์น˜๋ฅผ 2D coordinates๋กœ ํ‘œํ˜„ํ•œ ๊ฒƒ์ด๋‹ค.

์ด ์ •๋ณด๋“ค์„ ์–ป์œผ๋ฉด \((u,v)\) ๋ฅผ 3D position์ธ \((X,Y,Z)\)๋กœ liftํ•  ์ˆ˜ ์žˆ๋‹ค. ์ฆ‰, back-projectionํ•  ์ˆ˜ ์žˆ๋‹ค๋Š” ์†Œ๋ฆฌ๋‹ค. ๋‹ค์Œ์œผ๋กœ, Track-anything์œผ๋กœ moving foreground mask๋ฅผ ์–ป๋Š”๋‹ค. static background์™€ dynamic foreground๋ฅผ ๋‚˜๋ˆˆ๋‹ค๋Š” ๋œป์ด๋‹ค.

๊ฐ€์žฅ ์ค‘์š”ํ•œ ๋ถ€๋ถ„์œผ๋กœ, TAPIR ์ด๋ผ๋Š” ๋ชจ๋ธ์„ ์‚ฌ์šฉํ•ด์„œ ๋™์ผํ•œ point๋ฅผ ์—ฌ๋Ÿฌ frame์—์„œ trackingํ•œ๋‹ค.

๋งŒ์•ฝ ์–ด๋А pixel์„ trackingํ•œ๋‹ค๊ณ  ํ•œ๋‹ค๋ฉด,

\[p_0 = (320,320)\]

์ด ๋‹ค์Œ frame์—์„œ

\[p_1 = (330, 250)\]

์— ์œ„์น˜ํ•œ๋‹ค๋ฉด ์šฐ๋ฆฌ๋Š” 2D trajectory๋ฅผ ์–ป์„ ์ˆ˜ ์žˆ๊ฒŒ ๋œ๋‹ค. ๊ทธ๋Ÿฌ๋‚˜, ์ด๋Š” image plane์—์„œ์˜ 2D motion ์ด๋‹ค. ๊ทธ๋ ‡๋‹ค๋ฉด, 3D trajectory๋ฅผ ์–ป๊ธฐ์œ„ํ•ด ์•ž์—์„œ camera pose ์ •๋ณด์™€ depth ์ •๋ณด๋ฅผ ์‚ฌ์šฉํ•ด์„œ 2D trajectory๋ฅผ 3D trajectory๋กœ ๋ณ€ํ™˜ํ•œ๋‹ค. ์ฆ‰,

\[(u_t, v_t, D_t(u_t, v_t))\]

๋ฅผ ์ด์šฉํ•ด์„œ 3D point๋กœ back-projectํ•  ์ˆ˜ ์žˆ๋‹ค.

\[p_t^{2D}\]

๊ฐ€

\[X_t^{3D}\]

๊ฐ€ ๋˜๋„๋ก ํ•œ๋‹ค. ๊ทธ๋Ÿฌ๋‚˜, ํ•˜๋‚˜์˜ scene ์•ˆ์— ๋งŽ์€ Gaussian๋“ค์ด ์žˆ์„ํ…๋ฐ, ์ด ๋ชจ๋‘์— \(T_i(t)\)๋ผ๋Š” ๋…๋ฆฝ์ ์ธ motion trajectory๋ฅผ ํ•™์Šตํ•˜๋ฉด ๋น„ํšจ์œจ์ ์ด๋‹ค. ๋”ฐ๋ผ์„œ SoM์€ motion basis๋ผ๋Š” concept๋ฅผ ๋‚ด๋ฏผ๋‹ค. ์ด motion basis๋Š” ์ˆ˜์ฒœ, ์ˆ˜๋งŒ ๊ฐœ์˜ point๋“ค์ด ๊ฐ๊ฐ ์›€์ง์ด๋Š” ๊ฒŒ ์•„๋‹ˆ๋ผ ํ•˜๋‚˜์˜ motion basis๋ฅผ ๊ณต์œ ํ•˜์—ฌ ๋น„์Šทํ•œ transformation์„ ๊ณต์œ ํ•˜๋„๋ก ํ•˜๋Š” ๊ฒƒ์ด๋‹ค. ๋”ฐ๋ผ์„œ, ๊ฐ point๋“ค์ด ๊ทธ๋ฃน์„ ์ง€์–ด์„œ ๊ณตํ†ต motion structure๋ฅผ ๊ฐ€์ง„๋‹ค๊ณ  ์ƒ๊ฐํ•˜๋ฉด ๋œ๋‹ค.

SoM์€ ์ „์ฒด motion์„ ๋ช‡ ๊ฐœ์˜ motion basis๋กœ ์••์ถ•ํ•œ๋‹ค. SeeU์—์„œ๋Š” ๋‹ค์Œ๊ณผ ๊ฐ™์ด ํ‘œํ˜„ํ•œ๋‹ค:

\[P_t^i = P_0^i + B(t)w_i\]

์—ฌ๊ธฐ์„œ \(P_t^i\)๋Š” Gaussian i์˜ ์‹œ๊ฐ„ t์—์„œ์˜ ์ƒํƒœ๋ฅผ ๋งํ•œ๋‹ค. ์ฆ‰, ํ•ด๋‹น ์‹์€ Gaussian i์˜ ์ดˆ๊ธฐ์ƒํƒœ์— shared motion basis์™€ ๊ฐ€์ค‘์น˜์˜ ๊ณฑ์„ ๋”ํ•ด์„œ ํŠน์ • t ์‹œ๊ฐ„๋Œ€์˜ Gaussian i์˜ ์ƒํƒœ๋ฅผ ํ‘œํ˜„ํ•˜๋Š” ๊ฒƒ์ด๋‹ค. ์—ฌ๊ธฐ์„œ, ๊ฐ€์ค‘์น˜๋Š” shared motion basis๋ฅผ ์–ด๋–ป๊ฒŒ ์กฐํ•ฉํ•  ์ง€ ๊ฒฐ์ •ํ•˜๋Š” ์—ญํ• ์„ ํ•œ๋‹ค. ์ฆ‰, ๋ฌผ์ฒด๋ฅผ hardํ•˜๊ฒŒ ๋ถ„๋ฅ˜ํ•  ํ•„์š” ์—†์ด ์ ์ ˆํžˆ ์กฐํ•ฉํ•  ์ˆ˜ ์žˆ๋Š” soft motion decomposition์„ ๊ฐ€๋Šฅ์ผ€ ํ•œ๋‹ค.

์—ฌ๊ธฐ๊นŒ์ง€ ๋ณด๋ฉด, ์™œ SoM์ด Shape-Of-Motion ์ด๋ผ๋Š” ์ด๋ฆ„์„ ๊ฐ€์ง„์ง€ ๋Œ€์ถฉ ์œ ์ถ” ๊ฐ€๋Šฅํ•˜๋‹ค. ์ˆ˜๋งŽ์€ point๊ฐ€ ๋ณต์žกํ•˜๊ฒŒ ์›€์ง์ด๋Š” ๊ฒƒ์ฒ˜๋Ÿผ ๋ณด์—ฌ๋„ ์‹ค์ œ 3D motion์€ few motion bases๋กœ ์„ค๋ช…๋˜๋Š” low-dimensional structure๋ฅผ ๊ฐ€์ง€๊ณ  ์žˆ๋‹ค๊ณ  ๋ณด๋Š” ๊ฒƒ์ด๋‹ค.

์—ฌ๊ธฐ๊นŒ์ง€๊ฐ€ SoM์˜ ๊ธฐ๋ณธ ์„ค๋ช…์ด๋‹ค. ๋‹ค์Œ์œผ๋กœ SeeU๊ฐ€ ์ง„ํ–‰ํ•œ ๋ฐฉ์‹์„ ์„ค๋ช…ํ•˜๊ฒ ๋‹ค.

SoM์œผ๋กœ ์ˆ˜ํ–‰ํ•˜๊ฒŒ๋˜๋ฉด ๊ธฐ๋ณธ์ ์œผ๋กœ ๊ด€์ธก๋œ frame๋งˆ๋‹ค discreteํ•œ motion state๋ฅผ ์–ป๊ฒŒ ๋œ๋‹ค: ์˜ˆ๋ฅผ ๋“ค์–ด, ํ•˜๋‚˜์˜ point๊ฐ€ \(t=0, 1, 2, 3\)์—์„œ

\[B_0, B_1, B_2, B_3\]

๋ฅผ ์–ป๊ฒŒ ๋œ๋‹ค๊ณ  ํ•˜์ž.

๊ทผ๋ฐ ์šฐ๋ฆฌ๋Š” \(t = 1.37, -0.5, 5.2\) ๋“ฑ ๋ณด์ง€ ๋ชปํ•œ ์ž„์˜ ์‹œ๊ฐ„์—์„œ์˜ motion๋„ ์•Œ๊ณ  ์‹ถ์„ ์ˆ˜ ์žˆ๋‹ค. ์ด์—๋Œ€ํ•ด, SeeU๋Š” C4DD๋ผ๋Š” ๊ธฐ๋ฒ•์„ ๊ณ ์•ˆํ•œ๋‹ค.

C4DD ๊ธฐ๋ฒ•์€ ๊ธฐ์กด์— SoM์ด Discrete motion bases๋กœ ๋งŒ๋“ค์—ˆ๋‹ค๋ฉด, ์ด๋ฅผ ์‚ฌ์ง„๊ณผ ๊ฐ™์€ continuous B-spline์œผ๋กœ ๋งŒ๋“œ๋Š” ๊ฒƒ์„ ์˜๋ฏธํ•œ๋‹ค. B-spline์€ ์ปดํ“จํ„ฐ ๊ทธ๋ž˜ํ”ฝ์Šค์—์„œ ๋งŽ์ด ์‚ฌ์šฉ๋˜๋Š” ์—ฐ์† ํ•จ์ˆ˜ ์ค‘ ํ•˜๋‚˜๋‹ค. ์•Œ์•„๋‘๋ฉด ์ข‹๋‹ค.

๊ทธ๋Ÿฌ๋ฉด, SeeU๋Š” ์ „์ฒด์ ์œผ๋กœ ๋ณด์ž๋ฉด:

discrete 3D point trajectory์—์„œ Procrustes analysis๋กœ motion basis๋ฅผ ์ดˆ๊ธฐํ™”ํ•˜๊ณ  photometric reconstruction error๋กœ refineํ•œ ๋‹ค์Œ(SoM), ๊ทธ ๋‹ค์Œ SeeU๋Š” ์ด๊ฒƒ์„ B-spline์œผ๋กœ continuous function์œผ๋กœ ๋ฐ”๊พธ๊ฒŒ ๋œ๋‹ค.

์ €์ž๋“ค์€ ๋˜ํ•œ ์‹œ๊ฐ„์— ๋”ฐ๋ผ ์ง€์†๋˜๋Š” canonical 3D Gaussian set \(\{g_i^0\}_{i=1}^N\)์œผ๋กœ ํ‘œํ˜„ํ•˜๊ณ , ๋งค๊ฐœ๋ณ€์ˆ˜ํ™”๋ฅผ ์•„๋ž˜์ฒ˜๋Ÿผ ํ‘œํ˜„ํ•œ๋‹ค:

\[g_i^0 = (\mu_i^0, R_i^0, s_i, o_i, c_i)\]

์—ฌ๊ธฐ์„œ \(\mu\)๋Š” canonical mean, \(R\)์€ canonical orientation, \(s\)๋Š” scale์„, \(o\)๋Š” opacity๋ฅผ, \(c\)๋Š” color์„ ๋‚˜ํƒ€๋‚ธ๋‹ค. ์ฐจ๋ก€๋Œ€๋กœ, ๊ฐ ๋งค๊ฐœ๋ณ€์ˆ˜๋Š” ํ•˜๋‚˜์˜ ๊ฐ€์šฐ์‹œ์•ˆ์„ ํ‘œํ˜„ํ•  ๋•Œ ๊ฐ€์šฐ์‹œ์•ˆ์˜ ์œ„์น˜ ํ‰๊ท , ํšŒ์ „, ํฌ๊ธฐ, ๋ถˆํˆฌ๋ช…๋„, ์ƒ‰์ƒ ์—ญํ• ์„ ๋งก๋Š”๋‹ค๊ณ  ์ƒ๊ฐํ•˜๋ฉด ๋œ๋‹ค(3D, 4D vision์—์„œ 3D gaussian splatting ๊ธฐ๋ฒ•์ด ์‚ฌ์šฉ๋œ๋‹ค๋ฉด ํ•„์ˆ˜๋กœ ๋‚˜์˜ค๋Š” ๋งค๊ฐœ๋ณ€์ˆ˜๋“ค์ด๋‹ˆ ๊ผญ ์•Œ๊ณ  ์žˆ๊ธฐ๋ฅผ ๋ฐ”๋ž€๋‹ค).

์ž ์ด์ œ, gaussian์ด ํ”„๋ ˆ์ž„์˜ ํ๋ฆ„์— ๋”ฐ๋ผ ๋ณ€ํ™”ํ•˜๋Š” ๊ฒƒ๋„ ํ‘œํ˜„ํ•  ์ˆ˜ ์žˆ์–ด์•ผ ํ•œ๋‹ค. per-frame rigid transformation ์„ ํ†ตํ•ด์„œ:

\[T_{0 \rightarrow t} = [R_{0 \rightarrow t} , t_{0 \rightarrow t}] \in SE(3)\]

frame 0์—์„œ t์˜ ๋ณ€ํ™”๋Š” rotation๊ณผ translation matrix๋ฅผ ํ†ตํ•ด ํ‘œํ˜„์ด ๊ฐ€๋Šฅํ•˜๋‹ค:

\[\mu_i^t = R_{0 \rightarrow t}\mu_i^0 + t_{0 \rightarrow t},\; R_i^t = R_{0 \rightarrow t}R_i^0\]

์ž…๋ ฅ ํ”„๋ ˆ์ž„์— ๋Œ€ํ•ด MegaSaM์ด๋ผ๋Š” ๋ชจ๋ธ๋กœ ์นด๋ฉ”๋ผ ๋‚ด๋ถ€, ์™ธ๋ถ€ ํŒŒ๋ผ๋ฏธํ„ฐ, ๊ทธ๋ฆฌ๊ณ  ํ”„๋ ˆ์ž„ ๋ณ„ depth๋ฅผ ์ถ”์ •ํ•˜๊ณ , Track-anything ์ด๋ผ๋Š” ๋ชจ๋ธ๋กœ dynamic foreground์˜ mask๋ฅผ ํš๋“ํ•˜๊ณ , TAPIR์ด๋ผ๋Š” ๋ชจ๋ธ๋กœ 2D point track์„ ์ถ”์ถœํ•˜์—ฌ ํ”„๋ ˆ์ž„ ์ˆ˜์ค€์˜ camera pose ๋ฐ ์ „๊ฒฝ ๊ฐ€์šฐ์‹œ์•ˆ ์†์„ฑ \(P\)๋ฅผ ์ถœ๋ ฅํ•œ๋‹ค.

2nd stage: Discrete 4D \(\rightarrow\) Continuous 4D

์ด์ œ Discrete 4D ๋ฅผ Continuous 4D๋กœ ๋ฐ”๊พธ๋Š” ๊ณผ์ •์„ ๊ฑฐ์ณ์•ผ ํ•œ๋‹ค.

์ผ๋‹จ ์—ฌ๊ธฐ์„œ, ๋‘ ๊ฐ€์ง€ ํ‘œํ˜„์„ ์ •์˜ํ•˜๊ณ ์ž ํ•œ๋‹ค. ์•ž์„œ 1 stage์—์„œ ์–ป์€ camera pose์™€ ์ „๊ฒฝ ๊ฐ€์šฐ์‹œ์•ˆ์˜ ์†์„ฑ์„ ์•„๋ž˜์™€ ๊ฐ™์ด ํ‘œํ˜„ํ•œ๋‹ค:

\[C_t,\; P_t^i\]

๊ทธ๋ฆฌ๊ณ  ํ•ด๋‹น ๋…ผ๋ฌธ์€ ์ด๋ฅผ ์ง€์ ํ•œ๋‹ค:

  1. ํ•˜๋‚˜์˜ scene์— ์ˆ˜๋งŒ ๊ฐœ๊ฐ€ ๋„˜๋Š” ๊ฐ๊ฐ์˜ ๊ฐ€์šฐ์‹œ์•ˆ๋“ค์— ๊ฐœ๋ณ„์ ์œผ๋กœ 3D trajectory๋ฅผ ํ•™์Šต์‹œํ‚ค๋Š”๊ฑด ๋งค์šฐ ๋น„ํšจ์œจ์ ์ด๋‹ค.
  2. ๋ณต์›๋œ trajectory๋Š” smooth ํ•ด์•ผํ•˜๋ฉฐ, ๋ฌผ๋ฆฌ์ ์œผ๋กœ ํƒ€๋‹นํ•ด์•ผํ•œ๋‹ค.

์ด ์ค‘์—์„œ ์ฒซ ๋ฒˆ์งธ challenge๋ฅผ ํ•ด๊ฒฐํ•˜๊ธฐ ์œ„ํ•ด ๋‚ด๊ฐ€ ์•ž์—์„œ ์„ค๋ช…ํ•œ Shape-Of-Motion ๊ธฐ๋ฒ•์„ ๊ฐ€์ ธ์™€์„œ ํ•ด๋‹น ๋…ผ๋ฌธ ์ €์ž๋“ค์€ ์‚ฌ์šฉํ•œ๋‹ค. ๊ฐ„๋‹จํ•˜๊ฒŒ ๋งํ•˜๋ฉด, ๊ฐ ๊ฐ€์šฐ์‹œ์•ˆ์— ๊ฐœ๋ณ„์ ์œผ๋กœ motion์„ ์ฃผ์ž…ํ•˜๋Š” ๋ฐฉ์‹์ด ์•„๋‹ˆ๋ผ, ๊ฐ€์šฐ์‹œ์•ˆ๋“ค์ด ๊ณต์œ ํ•˜๋Š” global motion basis๋ฅผ ์‚ฌ์šฉํ•˜๊ฒŒ ํ•˜๋Š” ๊ฒƒ์ด๋‹ค. ์ด ๋ฐฉ์‹์„ ๋…ผ๋ฌธ์—์„œ๋Š” low-rank motion parameterization์ด๋ผ๊ณ  ํ‘œํ˜„ํ•œ๋‹ค.

๊ทธ๋Ÿฌ๋ฉด ์šฐ๋ฆฌ๋Š” foreground gaussian์˜ property๋ฅผ ๋‹ค์Œ๊ณผ ๊ฐ™์ด ํ‘œํ˜„ํ•  ์ˆ˜ ์žˆ๋‹ค:

\[P_t^i = P_0^i + \underbrace{B(t)}_{\in \mathbb{R}^{m \times K}} \underbrace{w_i}_{\in \mathbb{R}^{K}}, \;\;\;\; P_0^i,\; P_t^i \in \mathbb{R}^m\]

์—ฌ๊ธฐ์„œ \(B(t)\)๋Š” global motion basis functions์˜ ์ง‘ํ•ฉ์ด๊ณ , \(w_i\)๋Š” ๊ฐ€์šฐ์‹œ์•ˆ i์— ๋Œ€ํ•œ ์‹œ๊ฐ„ ๋ถˆ๋ณ€ ๊ณ„์ˆ˜ ๋ฒกํ„ฐ๋‹ค. ์ด๋ฅผ ํ†ตํ•ด, N๊ฐœ์˜ ์„œ๋กœ ๋‹ค๋ฅธ ๊ถค์ ์„ ์ง์ ‘ ํ•™์Šตํ•˜๋Š” ๋Œ€์‹ , ๊ณต์œ ๋˜๋Š” K๊ฐœ์˜ ๊ธฐ์ € ํ•จ์ˆ˜ \(B(t)\)๋ฅผ ํ†ตํ•ด ๊ฐ ๊ฐ€์šฐ์‹œ์•ˆ์€ ๋ช‡ ๊ฐœ์˜ coefficients ๋งŒ์œผ๋กœ ์กฐ๋ฐ€ํ•˜๊ฒŒ ํ‘œํ˜„๋œ๋‹ค.

์ด ์ด์‚ฐ์ ์ธ motion basis๋“ค์€ Procrustes analysis๋ฅผ ํ†ตํ•ด 3D ํฌ์ธํŠธ ๊ถค์ ๋“ค๋กœ๋ถ€ํ„ฐ ์ดˆ๊ธฐํ™”๋œ ํ›„์—, photometric reconstruction error๋ฅผ ์ตœ์†Œํ™”ํ•จ์œผ๋กœ์จ ์ ์ฐจ ์ •๊ตํ•ด์ง„๋‹ค(์ž์„ธํ•œ SoM์˜ ํ๋ฆ„์€ ์œ„์— Shape Of Motion์„ ๋ˆŒ๋Ÿฌ ์ž์„ธํžˆ ์‚ดํŽด๋ณด๊ธฐ๋ฅผ ๋ฐ”๋ž€๋‹ค).

์ด๋ ‡๊ฒŒ ์ฒซ ๋ฒˆ์งธ challenge๋ฅผ ํ†ตํ•ด ํšจ์œจ์ ์œผ๋กœ 3D trajectory๋ฅผ ๊ณ„์‚ฐํ•  ์ˆ˜ ์žˆ๊ฒŒ ๋˜์—ˆ๋‹ค.

๊ทธ๋Ÿฌ๋ฉด ๋‘ ๋ฒˆ์งธ challenge๋ฅผ ํ•ด๊ฒฐํ•˜๊ธฐ ์œ„ํ•ด ๋…ผ๋ฌธ์˜ ์ €์ž๋“ค์€ continuous representation ํ•ด์•ผํ•œ๋‹ค. ์ €์ž๋“ค์€ ์ด ๊ธฐ๋ฒ•์„ Continuous 4D Dynamics Model (C4DD)์ด๋ผ๊ณ  ํ‘œํ˜„ํ•œ๋‹ค. ์ €์ž๋“ค์ด ์‚ฌ์šฉํ•˜๋Š” continuous function์€ B-spline basis function์ด๋‹ค:

\[\hat{B}_t = \sum_{j=1}^M N_{j,d} (t) q_j\]

์—ฌ๊ธฐ์„œ \(N_{j,d}\)๊ฐ€ B-spline basis function ์ด๊ณ , \(q_j\)๋Š” motion basis๋ฅผ ์œ„ํ•œ ํ•™์Šต ๊ฐ€๋Šฅํ•œ control point๋‹ค. ์ด control point ๊ฐœ์ˆ˜ \(M\)์€ ๊ณก์„ ์˜ ํ‘œํ˜„ capacity๋ฅผ ์ œ์–ดํ•œ๋‹ค. \(M\)์ด ํด์ˆ˜๋ก ํ’๋ถ€ํ•œ ์‹œ๊ฐ„์  ํ‘œํ˜„์„ ๋‹ด์•„๋‚ผ ์ˆ˜ ์žˆ๋Š” ๋ฐ˜๋ฉด์—, \(M\)์ด ์ž‘์œผ๋ฉด smoothness์™€ regularization ํšจ๊ณผ๋ฅผ ๋ณด์—ฌ์ค€๋‹ค.

ํ•ด๋‹น ์ด๋ฏธ์ง€๋ฅผ ๋ณด๋ฉด ํŒŒ๋ž€์ƒ‰ ์„  ์œ„์— ์ ์ด ์žˆ๋Š” ๊ฒŒ ๋ณด์ผ ๊ฒƒ์ด๋‹ค. ์ด ๊ณก์„  ์™ธ๋ถ€์— ์žˆ๋Š” ๊ฐ€์ƒ์˜ ์ ์„ ์›€์ง์ด๋ฉด ํ•ด๋‹น ์˜์—ญ์˜ ๊ณก์„ ์˜ ๋ชจ์–‘์„ ๋ณ€๊ฒฝํ•  ์ˆ˜ ์žˆ๋‹ค. ๊ทธ๋ ‡๋‹ค๋ฉด ์ด ๋…ผ๋ฌธ์—์„œ ์„ค๋ช…ํ•˜๋Š” \(M\)์˜ ๊ฐœ์ˆ˜๋Š” ์‹ค์ œ ๊ณก์„ ์˜ ๋ชจ์–‘์„ ๊ฒฐ์ •ํ•˜๋Š” ๊ณก์„  ์™ธ๋ถ€์˜ ์  ์ฆ‰, control point์˜ ๊ฐœ์ˆ˜๋ฅผ ๋งํ•œ๋‹ค๊ณ  ๋ณด๋ฉด ๋œ๋‹ค. ์ด๋Š” ์ปดํ“จํ„ฐ ๊ทธ๋ž˜ํ”ฝ์Šค์—์„œ ์ž์ฃผ ๋“ฑ์žฅํ•˜๋Š” ๊ฐœ๋…์ด๋‹ค.

ํ•™์Šต ๋™์•ˆ, shared motion basis์˜ B-spline control points์™€ Camera trajectory์˜ B-spline Control points๋Š” ์ด objective function์„ ํ†ตํ•ด optimization ๋œ๋‹ค:

\[L_{total} = L_{data} + \lambda_{phys} L_{phys}\]

data term์€ C4DD๊ฐ€ ์ถ”์ •ํ•œ motion basis์™€ ์ฒซ ๋ฒˆ์งธ challenge์—์„œ ํ™•๋ณดํ•œ discrete ๊ด€์ธก๊ฐ’ ์‚ฌ์ด์˜ ์ผ๊ด€์„ฑ์„ ๊ฐ•์ œํ•œ๋‹ค:

\[L_{data} = \sum_{t \in \mathcal{T}_{obs}} \lVert \hat{B}_t - B_{obs}^t \rVert_2^2\]

์—ฌ๊ธฐ์„œ \(B_{obs}^t\)๋Š” t์—์„œ ๊ด€์ธก๋œ discrete motion basis(Procrustes analysis๋ฅผ ํ†ตํ•ด ์ถ”์ถœํ•˜๊ณ  photometric loss๋ฅผ ํ†ตํ•ด refine๋œ)๋ฅผ ๋‚˜ํƒ€๋‚ด๊ณ , \(\hat{B}_t\)์€ B-spline ๋งค๊ฐœ๋ณ€์ˆ˜ํ™”๋กœ๋ถ€ํ„ฐ ํ‰๊ฐ€๋œ C4DD์˜ ์˜ˆ์ธก๊ฐ’์ด๋‹ค. \(\mathcal{T}_{obs}\)๋Š” ๊ด€์ธก๋œ ์‹œ๊ฐ„๋Œ€๋กœ ๋ˆˆ์œผ๋กœ ์‹ค์ œ๋กœ ๊ด€์ฐฐํ•œ ํ”„๋ ˆ์ž„๋“ค์˜ ์‹ค์ œ ์‹œ์ ๋“ค์ด๋‹ค.

physics term์€ ํ•ด๋‹น ์ˆ˜์‹์˜ ๊ฐ ํ•ญ์˜ ๊ฐ€์†๋„๋ฅผ ์ค„์ด๋Š” ์—ญํ• ์„ ์ˆ˜ํ–‰ํ•œ๋‹ค:

\[L_{phys} = \mathbb{E}_{\tau_{ex}(t)} [\lVert \ddot{MB}_{trans}(t) \rVert_2^2 + \lVert \ddot{CAM}_{trans}(t) \rVert_2^2 + \mathbb{I}_{rot} \lVert \ddot{CAM}_{rot}(t) \rVert_2^2]\]

์—ฌ๊ธฐ์„œ \(\ddot{MB}_{trans}(t)\)์™€ \(\ddot{CAM}_{trans}(t)\)๋Š” ๊ฐ๊ฐ motion basis์™€ camera trajectory์—์„œ translational component์— ๋Œ€ํ•œ 2์ฐจ ๋ฏธ๋ถ„(๊ฐ€์†๋„)๋ฅผ ์ตœ์†Œํ™”ํ•˜๋„๋ก ํ•œ๋‹ค. ์ฆ‰, ๋“ฑ์†๋„๋‚˜ smoothํ•˜๊ฒŒ ์›€์ง์ด๋Š” ๊ฒƒ์œผ๋กœ ๊ฐ•์ œํ•œ๋‹ค. ๊ทธ๋ฆฌ๊ณ , \(\ddot{CAM}_{rot}(t)\)๋Š” camera trajectory์—์„œ ํšŒ์ „ ๊ฐ€์†๋„๋ฅผ ์ตœ์†Œํ™”ํ•˜๋„๋ก ํ•˜๋Š” ๊ฒƒ์ด๋ฉฐ, \(\mathcal{I}_{rot} \in \{0,1\}\)์˜ ๊ฒฝ์šฐ, ์นด๋ฉ”๋ผ ํšŒ์ „์ด ๊ฑฐ์˜ ์—†๋Š” ๋‹จ์ˆœํ•œ scene์—์„œ ์ด ์ œ์•ฝ์„ ๋Œ ์ˆ˜ ์žˆ๋„๋กํ•˜๋Š” ์žฅ์น˜๋‹ค.

์ถ”๊ฐ€์ ์œผ๋กœ \(\mathbb{E}_{\tau_{ex}(t)} [...]\) ๋Š” ์™ธ์‚ฝ ๊ฐ€์ค‘์น˜ ๊ธฐ๋Œ€๊ฐ’์œผ๋กœ, ๋น„๋””์˜ค๋กœ ์‹ค์ œ๋กœ ๊ด€์ธกํ•˜์ง€ ์•Š์€ ๊ณผ๊ฑฐ ํ˜น์€ ๋ฏธ๋ž˜ ์˜์—ญ์˜ ์‹œ๊ฐ„๋Œ€์ธ ์™ธ์‚ฝ์—์„œ \(\tau_{ex}(t)\)์ธ ๊ฐ€์ค‘์น˜ ํ•จ์ˆ˜๋ฅผ ํ†ตํ•ด ์‹œ๊ฐ„์ ์œผ๋กœ ๋ฉ€์–ด์งˆ์ˆ˜๋ก ๊ฐ€์ค‘์น˜๊ฐ€ ํ›จ์”ฌ ๋” ๋ฌด๊ฒ๊ฒŒ ์ปค์ง€๋„๋ก ์„ค๊ณ„๋˜์–ด์žˆ๋Š” ๊ฒƒ์„ ๋งํ•œ๋‹ค. ์—ฌ๊ธฐ์„œ ๊ธฐ๋Œ€๊ฐ’์ธ ๊ฐ€์ค‘ํ‰๊ท  ์—ฐ์‚ฐ์„ ํ†ตํ•ด ์ง„ํ–‰ํ•œ๋‹ค.

3rd stage: 4D \(\rightarrow\) 2D

์ด๋ ‡๊ฒŒ 2 stage๊ฐ€ ๋๋‚œ ํ›„, 2D video๋กœ projectionํ•˜๋Š” ๊ณผ์ •์„ ๊ฑฐ์ณ์•ผ ํ•œ๋‹ค.

์—ฌ๊ธฐ์„œ, scaffold video๋Š” occlusion region์ด ์กด์žฌํ•  ์ˆ˜ ์žˆ์œผ๋ฉฐ, ํˆฌ์˜๋œ ๊ฐ€์šฐ์‹œ์•ˆ๋“ค์ด ๋‚ฎ์€ ์‹ ๋ขฐ๋„๋ฅผ ๋ณด์ด๊ฑฐ๋‚˜ ๋ฌผ์ฒด ๊ฒฝ๊ณ„ ๋ฐ ๊ฐ€๋ ค์ง ๋“ฑ์ด ๋‚˜ํƒ€๋‚  ์ˆ˜ ์žˆ๋‹ค.

์ด๋ฅผ ํ•ด๊ฒฐํ•˜๊ธฐ ์œ„ํ•ด ํ•ด๋‹น ๋…ผ๋ฌธ์€ ๋น„๋””์˜ค ์ƒ์„ฑ ๋ชจ๋ธ์˜ spatial-temporal in-context ๋Šฅ๋ ฅ์„ ํ™œ์šฉํ•ด์„œ ํ”„๋ ˆ์ž„์„ ๋ณต์›ํ•œ๋‹ค. VLM์œผ๋กœ๋ถ€ํ„ฐ ์–ป์–ด๋‚ธ ๊ตฌ์กฐํ™”๋œ prompt(scene์— ๋Œ€ํ•œ caption), 2 stage์—์„œ ๋งŒ๋“  4D scene์„ 2D ๋กœ projectionํ•œ ํ”„๋ ˆ์ž„๋“ค, ๊ทธ๋ฆฌ๊ณ  ๊ทธ ํ”„๋ ˆ์ž„๋“ค์—์„œ occlusion์ด ์ผ์–ด๋‚œ ์˜์—ญ์— ๋Œ€ํ•œ inpainting mask๋“ค. Context Encoder๋Š” ์ด๋Ÿฐ ์ •๋ณด๋“ค์„ ๋งž์•„ context embedding์„ ์ƒ์„ฑํ•˜๊ณ , ์ด๋ฅผ pretrained ๋œ video generator์— ์ฃผ์ž…ํ•œ๋‹ค. ์ด๋ฅผ ํ†ตํ•ด Unseen frame์— ๋Œ€ํ•œ ๊ฒฐ๊ณผ๋ฌผ์„ ๋„์ถœํ•œ๋‹ค.

์ด์ œ figure 3๋ฅผ ๋ณด๋ฉด์€ ๋ช…์พŒํžˆ ์ดํ•ด๊ฐ€ ๊ฐ€๋Šฅํ•˜๋‹ค. ์ด ๋…ผ๋ฌธ์€ ๊ฒฐ๊ตญ

sparseํ•œ ๋น„๋””์˜ค ์ž…๋ ฅ์„ ๋ฐ›์•„ 4D scene์œผ๋กœ reconstruction ํ•˜์—ฌ physical ๊ทธ๋ฆฌ๊ณ , 3D geometry๋ฅผ consistent๋ฅผ ์œ ์ง€ํ•˜๋Š” ์ƒํƒœ์—์„œ video generator๊ฐ€ ๊ณผ๊ฑฐ ํ˜น์€ ๋ฏธ๋ž˜ ํ˜น์€ sparse ๋น„๋””์˜ค frame์„ ์ œ์™ธํ•œ ์—ฌ๋Ÿฌ ์‹œ์ ์—์„œ์˜ frame์„ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ๋„๋ก ๋„์™€์ฃผ๋Š” pipeline์„ ๋งŒ๋“  ๊ฒƒ

์‚ฌ์‹ค ๋…ผ๋ฌธ์—๋Š” โ€œ2. Why model Continuous Dynamics in 4Dโ€๋ผ๋Š” ์„น์…˜์ด method ์„น์…˜ ์ „์— ์กด์žฌํ•˜๋Š”๋ฐ, ์ด ๋ฆฌ๋ทฐ๋ฅผ ์“ฐ๋Š” ์ €์ž๋Š” method๋ฅผ ์ฝ๊ณ  ํ•ด๋‹น ์„น์…˜์„ ์ฝ์œผ๋ฉด ์ดํ•ด๊ฐ€ ๋” ์ž˜ ๋๋‹ค.

  1. ๊ธฐ์กด์˜ ๋น„๋””์˜ค ์ƒ์„ฑ๋ชจ๋ธ๋“ค์€ 3D ๊ณต๊ฐ„ ํ‘œํ˜„์ด ์—†๊ธฐ ๋•Œ๋ฌธ์—, ์นด๋ฉ”๋ผ ์‹œ์ ์ด ๋ฐ”๋€Œ๊ฑฐ๋‚˜ ๋ฌผ์ฒด๊ฐ€ ๋ฌผ์ฒด ๋’ค๋กœ ์ˆจ๋Š” occlusion ํ˜„์ƒ์ด ๋ฐœ์ƒํ•˜๋ฉด ํ˜•ํƒœ๊ฐ€ ์ด์ƒํ•ด์ง€๊ฑฐ๋‚˜ ์ž…์ฒด๊ฐ์ด ๊นจ์ง„๋‹ค. ์ถ”๊ฐ€์ ์œผ๋กœ, video ์ƒ์„ฑ ๋ชจ๋ธ๋“ค์€ ์ด์ „ ํ”„๋ ˆ์ž„์— ์žˆ๋˜ ํ”ฝ์…€๋“ค์„ ์˜จ์ „ํ•˜๊ฒŒ ์ €์žฅํ•˜์ง€ ๋ชปํ•œ๋‹ค. ๊ทธ๋Ÿฐ๋ฐ 3D ๊ณต๊ฐ„์— ๋†“์ธ ๊ฐ€์šฐ์‹œ์•ˆ๋“ค์€ 3D ๊ณต๊ฐ„ ํ‘œํ˜„ ์•„๋ž˜ ๊ณ„์† ์œ ์ง€๋˜๋ฏ€๋กœ ์ตœ์ ํ™”๋ฅผ ์ž˜ํ•˜๋ฉด ์—ฌ๋Ÿฌ ์นด๋ฉ”๋ผ ์‹œ์ ์—์„œ๋„ ์ผ์ •ํ•œ geometry๋ฅผ ๊ฐ€์งˆ ์ˆ˜ ์žˆ๋‹ค(์™œ ๋งŽ์€ novel view synthetic ๋ฐฉ์‹์˜ video generation ๋…ผ๋ฌธ๋“ค์ด point cloud๋‚˜ 3DGS๋ฅผ ์‚ฌ์šฉํ•˜๋Š”์ง€ ์–ด๋ ดํ’‹์ด ์ดํ•ด๊ฐ€ ๊ฐ„๋‹ค.).
  2. 2D ํ™”๋ฉด ์ƒ์—์„œ ์›€์ง์ž„์„ ์ถ”์ ํ•˜๋ฉด ์›๊ทผ๋ฒ•๊ณผ ์นด๋ฉ”๋ผ ํ”๋“ค๋ฆผ ๋•Œ๋ฌธ์— ๊ถค์ ์ด ๋งค์šฐ ๋ณต์žกํ•˜์ง€๋งŒ, ์›๋ž˜ 4D(3D) coordinates์—์„œ ๋ฐ”๋ผ๋ณด๋ฉด ๋ฌผ๋ฆฌ ๋ฒ•์น™ ๋•Œ๋ฌธ์— ์›€์ง์ž„์ด ํ›จ์”ฌ ๋‹จ์ˆœํ•˜๊ณ  ๊ทœ์น™์ ์ด๋‹ค. ๊ทธ๋ฆฌ๊ณ  C4DD ๊ธฐ๋ฒ•์„ ์‚ฌ์šฉํ•˜๋ฉด ์—ฐ์†์ ์ธ ๊ณผ์ •์œผ๋กœ ์ด๋ฅผ ํ‘œํ˜„ํ•  ์ˆ˜ ์žˆ์–ด ์ž„์˜์˜ ์‹œ์ ์„ ์ž์—ฐ์Šค๋Ÿฝ๊ฒŒ ์ฑ„์šธ ์ˆ˜ ์žˆ๋‹ค.
  3. ์นด๋ฉ”๋ผ์˜ ์›€์ง์ž„ ๊ทธ๋ฆฌ๊ณ  ๊ฐ์ฒด์˜ ์›€์ง์ž„ ๋“ฑ์˜ ๋ณ€ํ™”๊ฐ€ 2D ๋น„๋””์˜ค์—์„œ๋Š” ๋ถ„๋ฆฌ๋˜์–ด ์žˆ์ง€ ์•Š๊ณ  ์ข…์†์ ์ด๊ธฐ ๋•Œ๋ฌธ์— ์•ˆ์ •์ ์ธ ๊ธฐ์ค€ ์ขŒํ‘œ๊ณ„๊ฐ€ ์—†๋‹ค. ๊ทธ๋ ‡๊ธฐ ๋•Œ๋ฌธ์— ํ•™์Šต์ด ์–ด๋ ค์šด๋ฐ, SeeU์˜ ๊ฒฝ์šฐ์—๋Š” ๊นŠ์ด ์ถ”์ •๊ณผ ํŠธ๋ž˜ํ‚น ๊ธฐ๋ฒ•์„ ํ™œ์šฉํ•ด์„œ Background์™€ foreground๋กœ ๋‚˜๋ˆ„๊ณ , ์นด๋ฉ”๋ผ ํฌ์ฆˆ๋ฅผ ๋ฌผ๋ฆฌ์ ์œผ๋กœ ๋ถ„๋ฆฌํ•œ๋‹ค.

์ด๋ ‡๊ธฐ ๋•Œ๋ฌธ์— SeeU๋Š” ํŒŒ์ดํ”„๋ผ์ธ์„ ์œ„์™€ ๊ฐ™์ด ์„ค๊ณ„ํ–ˆ๋‹ค๊ณ  ๋ณด๋ฉด ๋œ๋‹ค.

Experiments

Datasets & Training details

๋…ผ๋ฌธ์˜ ์ €์ž๋“ค์€ ์ž์ฒด์ ์œผ๋กœ ์ดฌ์˜ํ•œ ์˜์ƒ ๋ฐ ์˜คํ”ˆ ๊ณต๊ฐœ ์†Œ์Šค์—์„œ ์ˆ˜์ง‘ํ•œ 45๊ฐœ์˜ ๋™์ ์ธ ์žฅ๋ฉด์„ ํ†ตํ•ด ํ‰๊ฐ€๋ฅผ ์ง„ํ–‰ํ•œ๋‹ค:

  1. ๋น„๋””์˜ค ํฌ์ธํŠธ ์ถ”์  ๋ฒค์น˜๋งˆํฌ์ธ TAP-vid
  2. ๊ณ ํ”„๋ ˆ์ž„ rate ๋ฐ์ดํ„ฐ์…‹์ธ I2-2000FPS
  3. robotics video set์ธ AgiBot World
  4. Animal Kingdom dataset

ํ•ด๋‹น ๊ณต๊ฐœ ์†Œ์Šค ๋ฐ์ดํ„ฐ์…‹๋“ค์„ ํ™œ์šฉํ•œ๋‹ค.

์ด๋“ค์€ NVIDIA A100 (80GB) GPU 1๊ฐœ๋ฅผ ์‚ฌ์šฉํ•˜๋ฉฐ, Adam optimizer๋ฅผ ์‚ฌ์šฉํ•ด ์ตœ์ ํ™”ํ•œ๋‹ค. ์ด์™ธ์—๋„ 1st stage, 2nd stage, 3rd stage์— ๊ด€๋ จํ•œ training detail๋“ค์€ ์ง์ ‘ ๋…ผ๋ฌธ์„ ํ™•์ธํ•˜๊ธธ ๋ฐ”๋ž€๋‹ค.

Results

Temporally Unseen Generation ์„ ํ‰๊ฐ€ํ•˜๊ธฐ ์œ„ํ•ด์„œ Table 1์„ ๋ณด๋Š” ๊ฒƒ๊ณผ ๊ฐ™์ด Past frame, Dynamic Frame Interpolation(frame๊ณผ frame ์‚ฌ์ด), Future frame์„ inferenceํ•˜๊ณ  PSNR, SSIM, LPIPS, C-LPIPS ์ง€ํ‘œ๋“ค์„ ์‚ฌ์šฉํ•˜์—ฌ ํ‰๊ฐ€ํ•˜์˜€๋‹ค. ๊ทธ๋ฆฌ๊ณ , past, dynamic, future์„ ๋ชจ๋‘ ์ข…ํ•ฉ์ ์œผ๋กœ inferenceํ•˜๋Š” ๋ชจ๋ธ์ด ์—†์–ด dynamic, future๋ฅผ ๊ฐ๊ฐ inference ํ•˜๋Š” ๋ชจ๋ธ InterpAny, Wan2.2, Cosmos๋ฅผ ๊ธฐ์กด SOTA ๋ชจ๋ธ๋กœ์จ ํ‰๊ฐ€ํ–ˆ๋‹ค.

๋˜ํ•œ, SoM๊ณผ VACE๋Š” ๊ฐ๊ฐ ๊ธฐ์กด ์—ฐ๊ตฌ๋“ค์˜ ๊ธฐ๋ฒ•์ด์ง€๋งŒ, ๊ณผ๊ฑฐ frame, frame interpolation, ๋ฏธ๋ž˜ frame์„ ์ฒ˜๋ฆฌํ•  ์ˆ˜ ์žˆ๋„๋ก ํ™•์žฅํ•˜์—ฌ ์ง„ํ–‰ํ•˜์˜€๋‹ค. VACE์˜ ๊ฒฝ์šฐ์—๋Š” Unseen ํ”„๋ ˆ์ž„๋“ค์„ ๋งˆ์Šคํ‚น ์ฒ˜๋ฆฌํ•˜์—ฌ ์ „์ฒด ์‹œ๊ฐ„ ๋ฒ”์œ„๋ฅผ ๋ณต์›ํ•  ์ˆ˜ ์žˆ๋„๋ก ํ™•์žฅํ•˜๊ณ , SoM์˜ ๊ฒฝ์šฐ์—๋Š” motion ์ถ”์ •์„ linear interpolation์œผ๋กœ linear extrapolation ๊ธฐ๋ฒ•์„ ๊ฒฐํ•ฉํ•ด์„œ ์ „์ฒด ์‹œ๊ฐ„ ๋ฒ”์œ„๋ฅผ ๋ณต์›ํ•  ์ˆ˜ ์žˆ๋„๋ก ์–ต์ง€๋กœ ํ™•์žฅํ•˜์˜€๋‹ค.

SeeU๋Š” ํ›จ์”ฌ ๋” ๊ฐ•๋ ฅํ•œ ์—ฐ์† ์‹œ๊ฐ„ ์—ญํ•™ ์ธ์ง€(continuous-time dynamics awareness)์™€ 3D ๊ธฐํ•˜ํ•™์  ํ•ด์„ ๋Šฅ๋ ฅ์„ ๋ณด์—ฌ์ฃผ์—ˆ๋‹ค.

๋˜ํ•œ figure 4๋ฅผ ๋ณด๊ธฐ์—๋„ SeeU๋Š” ํ›จ์”ฌ ๋” ๊ฐ•๋ ฅํ•œ ์—ฐ์† ์‹œ๊ฐ„ ์—ญํ•™ ์ธ์ง€(continuous-time dynamics awareness)์™€ 3D ๊ธฐํ•˜ํ•™์  ํ•ด์„ ๋Šฅ๋ ฅ์„ ๋ณด์—ฌ์ฃผ์—ˆ๋‹ค.

์ถ”๊ฐ€์ ์œผ๋กœ figure 5๋ฅผ ๋ณด๋ฉด ์ƒˆ๋กœ์šด insight๋ฅผ ํ™•์ธํ•  ์ˆ˜ ์žˆ๋Š”๋ฐ, ๊ณผ๊ฑฐ 50%, ๋ฏธ๋ž˜ 50% ์˜์—ญ ์ฆ‰, ์™ธ์‚ฝ๋œ ์˜์—ญ์—์„œ ์‹œ๊ฐ„์  ๊ฑฐ๋ฆฌ๊ฐ€ ๋ฉ€์–ด์ง์—๋”ฐ๋ผ ์ •ํ™•๋„๊ฐ€ ์„ ํ˜•์ ์œผ๋กœ ๊ฐ์†Œํ•˜๋Š” ๊ฒƒ์„ ํ™•์ธํ•  ์ˆ˜ ์žˆ์—ˆ๋‹ค.

Spatially Unseen Generation์„ ํ‰๊ฐ€ํ•˜๊ธฐ ์œ„ํ•ด Table 2์„ ๋ณด๋Š” ๊ฒƒ๊ณผ ๊ฐ™์ด ์—ฌ๋Ÿฌ ์นด๋ฉ”๋ผ ์ œ์–ด ๋ฐฉ์‹์„ ๊ฐ๊ฐ ์นด๋ฉ”๋ผ ์ œ์–ด๊ฐ€ ๊ฐ€๋Šฅํ•œ ๋น„๋””์˜ค ๋ชจ๋ธ์ธ GCD, ReCamMaster ๊ณผ ๋น„๊ตํ•˜์˜€๋‹ค.

table 2๋ฅผ ๋ณด์•˜์„ ๋•Œ, SeeU๊ฐ€ ๋ชจ๋“  ๋ฒ ์ด์Šค๋ผ์ธ๋ณด๋‹ค ๋” ๋†’์€ ๊ธฐํ•˜ํ•™์  ์ •ํ™•๋„(EE ๋ฐ EIR)์™€ ์žฅ๋ฉด ์ผ๊ด€์„ฑ(CLIP-V)์„ ๋‹ฌ์„ฑํ•จ์„ ๋ณด์—ฌ์ฃผ๋ฉฐ, Figure 6๋ฅผ ๋ณด์•˜์„ ๋•Œ SeeU๊ฐ€ ๋” ํ’๋ถ€ํ•œ ์žฅ๋ฉด ๋””ํ…Œ์ผ์„ ๋ Œ๋”๋งํ•  ์ˆ˜ ์žˆ๋Š” ๋Šฅ๋ ฅ์„ ๊ฐ–์ถ”๊ณ  ์žˆ์Œ์„ ๋ณด์—ฌ์ค€๋‹ค.

Table 3๋ฅผ ๋ณด๋‹ค์‹œํ”ผ, ablation study๋Š” 3๊ฐœ์˜ ๋ฐฉํ–ฅ์œผ๋กœ ์ง„ํ–‰๋˜์—ˆ๋‹ค:

  1. B-spline parameterization ์„ plain MLP layers๋กœ ๋ฐ”๊พธ๋Š” ๊ฒƒ
  2. physics loss weight \(\lambda_{phys}\) ๋ฅผ 0์œผ๋กœ ๋ฐ”๊พธ์–ด ํ•ด๋‹น physics loss term์˜ ํšจ๊ณผ ์ œ๊ฑฐ
  3. sparseํ•œ frame ์ˆ˜๋ฅผ 5, 10, 15, 20 ๊ฐœ๋กœ ์—ฌ๋Ÿฌ input frame ์ˆ˜๋ฅผ ์กฐ์ ˆํ•˜์—ฌ ์‹คํ—˜

Table 3๋ฅผ ๋ณด๋‹ค์‹œํ”ผ, ๋จผ์ € continuous dynamics๋ฅผ ์œ„ํ•œ B-spline์˜ inductive bias๋Š” smoothness์™€ physical consistency ์ธก๋ฉด์—์„œ ์žฅ์ ์„ ๊ฐ€์ง์„ ๋ณผ ์ˆ˜ ์žˆ๋‹ค. ๊ทธ๋ฆฌ๊ณ , physics loss term๋„ continuous dynamics๋ฅผ ์•ˆ์ •ํ™”ํ•˜๋Š”๋ฐ ๋„์›€์„ ์ฃผ๋Š” ๊ฒƒ์œผ๋กœ ๋ณด์ด๋ฉฐ, input frame ์ˆ˜๊ฐ€ ์ ์  sparse ํ•ด์ง€๋”๋ผ๋„ robustํ•˜๊ฒŒ ์„ฑ๋Šฅ์„ ์œ ์ง€ํ•˜๋Š” ๊ฒƒ์ด ๋ณด์ธ๋‹ค(์ง€๊ธˆ ์ด ๋…ผ๋ฌธ์„ ๋ฆฌ๋ทฐํ•˜๋Š” ๋‚ด๊ฐ€ ๋ณด๊ธฐ์—๋Š” table 1์˜ ๋ชจ๋ธ๋“ค์˜ input condition์„ ๋น„๊ตํ•ด๋ด์•ผ ์ •ํ™•ํžˆ frame์— ๋Œ€ํ•œ ์žฅ์ ์ด ์žˆ๋Š”์ง€ ํ™•์ธ์ด ๊ฐ€๋Šฅํ•  ๊ฒƒ ๊ฐ™๋‹ค).

Contributions

  1. 2D Projection ์ด๋ฏธ์ง€๋กœ๋ถ€ํ„ฐ ์—ฐ์†์ ์ธ 4D Dynamics์„ ์ง์ ‘ ํ•™์Šตํ•˜์—ฌ ๋ณด์ด์ง€ ์•Š๋Š” ์‹œ๊ณต๊ฐ„ ์˜์—ญ(๊ณผ๊ฑฐ/๋ฏธ๋ž˜/์ƒˆ๋กœ์šด ์‹œ์ )์„ ์ƒ์„ฑํ•˜๊ณ  ๋น„๋””์˜ค๋ฅผ ์ •๊ตํ•˜๊ฒŒ ํŽธ์ง‘ํ•  ์ˆ˜ ์žˆ๋Š” ์ƒˆ๋กœ์šด ๊ฐœ๋…์ธ โ€˜SeeUโ€™๋ฅผ ์ œ์•ˆํ–ˆ๋‹ค.
  2. 2D ์ž…๋ ฅ ๋ฐ์ดํ„ฐ๋กœ๋ถ€ํ„ฐ 4D ๋ฌผ๋ฆฌ ์—ญํ•™์„ ๋ช…์‹œ์ ์œผ๋กœ ํ•™์Šตํ•œ ๋’ค ๋‹ค์‹œ ๊ณ ํ’ˆ์งˆ 2D ๋น„๋””์˜ค ์ฝ˜ํ…์ธ ๋ฅผ ์žฌํˆฌ์˜ํ•ด ๋‚ด๋Š” ํ•™๊ณ„ ์ตœ์ดˆ์˜ โ€˜2D \(\rightarrow\) 4D \(\rightarrow\) 2Dโ€™ ํ•™์Šต ํ”„๋ ˆ์ž„์›Œํฌ ํŒจ๋Ÿฌ๋‹ค์ž„์„ ์ •๋ฆฝํ–ˆ๋‹ค.

Limitations & Future works

ํ•ด๋‹น ๋…ผ๋ฌธ์˜ input ๋ฐ์ดํ„ฐ๋“ค์€ ์ „๊ฒฝ์˜ ์›€์ง์ž„๊ณผ camera pose์˜ ๋ณ€ํ™”๊ฐ€ smoothํ•˜๊ณ  ๋ช…ํ™•ํ•œ ๊ฒƒ๋“ค์„ ๊ธฐ์ค€์œผ๋กœ ์ง„ํ–‰ํ•˜์˜€๋‹ค. ์ฆ‰, ์ „๊ฒฝ์ด ๋†๊ตฌ ์„ ์ˆ˜๋“ค์ฒ˜๋Ÿผ ๋งค ์ˆœ๊ฐ„ ๋น ๋ฅด๊ฒŒ ๋ณ€ํ™”ํ•˜๊ฑฐ๋‚˜ ๋ณ€์น™์ ์ด์ง€ ์•Š์œผ๋ฉฐ camera ์‹œ์ ์˜ ๋ณ€ํ™”๊ฐ€ ๊ทน์ ์ด์ง€ ์•Š๊ธฐ ๋•Œ๋ฌธ์— ์™„์ „ํ•œ out-of-distribution์—์„œ๋Š” ๋ฌธ์ œ๊ฐ€ ์žˆ์„ ๊ฒƒ์ด๋ผ๊ณ  ๋ณธ๋‹ค.