Paper Information
Title: FlashWorld: High-Quality 3D Scene Generation within Seconds
Authors: Xinyang Li, Tengfei Wang, Zixiao Gu, Shengchuan Zhang, Chunchao Guo, Liujuan Cao
Venue: ICLR 2026 Oral
Link: [Paper], [Project], [Github]

Teaser Image (Poster)

Introduction

3D Generation ๋ถ„์•ผ๋Š” ํฌ๊ฒŒ ์„ฑ์žฅํ•˜๊ณ  ์žˆ๋Š” ๋ถ„์•ผ์ด์ง€๋งŒ, scarcity of high-quality 3D scene data์™€ exponential complexity of modeling real-world scenes๋ผ๋Š” ๋‘ ๊ฐœ์˜ ํฐ ์žฅ์• ๋ฌผ ๋•Œ๋ฌธ์— ์–ด๋ ค์›€์„ ๊ฒช๊ณ  ์žˆ๋‹ค๊ณ  ๋งํ•œ๋‹ค.

์—ฌ๊ธฐ์—๋Š” ํฌ๊ฒŒ 2๊ฐœ์˜ ํŒจ๋Ÿฌ๋‹ค์ž„์ด ์žˆ๋‹ค.

๋จผ์ € multi-view-oriented(MV-oriented) ํŒŒ์ดํ”„๋ผ์ธ์ด๋‹ค. diffusion model์ด ํ…์ŠคํŠธ๋‚˜ ์ฐธ์กฐ ์ด๋ฏธ์ง€๋กœ๋ถ€ํ„ฐ ์—ฌ๋Ÿฌ ์‹œ์ ์˜ ์ด๋ฏธ์ง€๋“ค์„ ๋จผ์ € ์ƒ์„ฑํ•œ ๋‹ค์Œ, 3D reconstruction์„ ์ˆ˜ํ–‰ํ•˜๋Š” ๋ฐฉ์‹์ด๋‹ค. ๊ทธ๋Ÿฌ๋‚˜ ์‹œ์  ํ•ฉ์„ฑ ๊ณผ์ •์—์„œ ๋ช…์‹œ์ ์ธ 3D ์ œ์•ฝ ์กฐ๊ฑด์ด ์—†์–ด geometric ํ˜น์€ semantic inconsistencies๋ฅผ ๋ฐœ์ƒ์‹œํ‚ฌ ์ˆ˜ ์žˆ๋‹ค. ๊ฒŒ๋‹ค๊ฐ€ ์ด๋Š” ์ƒ๋‹นํ•œ computational overhead๊ฐ€ ๋ฐœ์ƒํ•˜๊ณ  ์ƒ์„ฑ ์‹œ๊ฐ„๋„ ์ƒ๋‹นํ•˜๋‹ค๋Š” ๊ฒƒ์„ ์•Œ ์ˆ˜ ์žˆ๋‹ค.

diffusion model์˜ ํšจ์œจ์„ฑ์„ ๋†’์ด๊ธฐ ์œ„ํ•ด, post-training distillation ๊ธฐ์ˆ ๋“ค์ด ์ž์ฃผ ์‚ฌ์šฉ๋œ๋‹ค. ์ด๋Ÿฌํ•œ distillation ๊ธฐ๋ฒ•์„ ์ง์ ‘ ์ ์šฉํ•˜๋ฉด ํ”„๋ ˆ์ž„์›Œํฌ๊ฐ€ ๋ณธ์งˆ์ ์œผ๋กœ ๊ฐ€์ง„ ํ•œ๊ณ„์ ์„ ์˜คํžˆ๋ ค ์ฆํญ์‹œํ‚ค๊ฒŒ ๋  ์ˆ˜ ์žˆ๋‹ค.

๋‹ค์Œ์œผ๋กœ 3D-oriented ํŒจ๋Ÿฌ๋‹ค์ž„์ด๋‹ค. ์ด ๋ฐฉ์‹์€ diffusion model์ด๋ž‘ ๋ฏธ๋ถ„๊ฐ€๋Šฅํ•œ rendering์„ combineํ•˜๋Š” ๊ฒƒ์ด๋‹ค. ์ด ๋ฐฉ์‹์€ ๋ฌผ์ฒด๋‚˜ ๋ฐฐ๊ฒฝ์˜ ๊ธฐํ•˜ํ•™์  ํ˜•ํƒœ๊ฐ€ ์–ด๊ธ‹๋‚˜์ง€ ์•Š๊ณ  ๋ฌผ๋ฆฌ์  ์ผ๊ด€์„ฑ์„ ์œ ์ง€ํ•˜๋‚˜ ํ™”์งˆ์ด ๋‹ค์†Œ ํ๋ฆฟํ•ด์ง€๋Š” ๋ฌธ์ œ๊ฐ€ ์žˆ๋‹ค. ๊ฒŒ๋‹ค๊ฐ€ refinement stage๋ฅผ ์ถ”๊ฐ€๋กœ ํ•„์š”๋กœํ•œ๋‹ค.

Preliminary

FlashWorld์˜ ํ•ต์‹ฌ์ธ cross-mode post-training์„ ์ดํ•ดํ•˜๊ธฐ ์œ„ํ•ด์„œ๋Š” ๋จผ์ € Diffusion Model๊ณผ Distribution Matching Distillation (DMD)์— ๋Œ€ํ•œ ์ดํ•ด๊ฐ€ ํ•„์š”ํ•˜๋‹ค.

Diffusion Model

Diffusion model์€ ์ผ๋ฐ˜์ ์œผ๋กœ Gaussian noise์—์„œ ์‹œ์ž‘ํ•˜์—ฌ ์ ์ง„์ ์œผ๋กœ noise๋ฅผ ์ œ๊ฑฐํ•˜๋ฉด์„œ target data distribution์˜ sample์„ ์ƒ์„ฑํ•œ๋‹ค.

์›๋ณธ ๋ฐ์ดํ„ฐ \(x\)์— timestep \(t\)์— ๋”ฐ๋ฅธ Gaussian noise๋ฅผ ์ถ”๊ฐ€ํ•˜๋Š” forward process๋Š” ๋‹ค์Œ๊ณผ ๊ฐ™์ด ์ •์˜๋œ๋‹ค:

\[x_t = F(x,t) = \alpha_t x + \sigma_t \epsilon, \qquad \epsilon \sim \mathcal{N}(0,I)\]

์—ฌ๊ธฐ์„œ \(\alpha_t\)์™€ \(\sigma_t\)๋Š” timestep \(t\)์— ๋”ฐ๋ฅธ signal๊ณผ noise์˜ ๋น„์œจ์„ ๊ฒฐ์ •ํ•œ๋‹ค.

์ฆ‰,

\[x_t = \underbrace{\alpha_t x}_{\text{signal}} + \underbrace{\sigma_t\epsilon}_{\text{noise}}\]

๋กœ ๋ณผ ์ˆ˜ ์žˆ๋‹ค.

Denoising network๋Š” noisy sample \(x_t\)์™€ timestep \(t\)๋ฅผ ์ž…๋ ฅ์œผ๋กœ ๋ฐ›์•„ ์›๋ž˜์˜ clean data \(x\)๋ฅผ ์˜ˆ์ธกํ•˜๋„๋ก ํ•™์Šต๋œ๋‹ค.

\[\mathcal{L} = \mathbb{E}_{x,t,\epsilon} \left[ \left\| x-\hat{x}_\theta(x_t,t) \right\|^2 \right]\]

์œ„ ์ˆ˜์‹์—์„œ๋Š” clean data \(x\)๋ฅผ ์ง์ ‘ ์˜ˆ์ธกํ•˜๋Š” \(x\)-prediction์„ ์‚ฌ์šฉํ•˜์ง€๋งŒ, diffusion model์€ noise \(\epsilon\)์„ ์˜ˆ์ธกํ•˜๊ฑฐ๋‚˜ \(x\)์™€ \(\epsilon\)์˜ ์„ ํ˜• ๊ฒฐํ•ฉ์ธ \(v\)๋ฅผ ์˜ˆ์ธกํ•˜๋Š” ๋ฐฉ์‹์œผ๋กœ๋„ ํ•™์Šต๋  ์ˆ˜ ์žˆ๋‹ค.

์ด๋Ÿฌํ•œ prediction๋“ค์€ ๋ชจ๋‘ denoised estimate \(\mu(x_t,t)\)๋กœ ๋ณ€ํ™˜ํ•  ์ˆ˜ ์žˆ์œผ๋ฉฐ, ์ด๋ฅผ ์ด์šฉํ•˜๋ฉด distribution์˜ score๋ฅผ ๋‹ค์Œ๊ณผ ๊ฐ™์ด ํ‘œํ˜„ํ•  ์ˆ˜ ์žˆ๋‹ค.

\[s(x_t,t) = \nabla_{x_t}\log p_t(x_t) = - \frac{x_t-\alpha_t\mu(x_t,t)} {\sigma_t^2}\]

Score

\[s(x_t,t)=\nabla_{x_t}\log p_t(x_t)\]

๋Š” ํ˜„์žฌ sample \(x_t\)๊ฐ€ ํ•ด๋‹น data distribution์—์„œ probability๊ฐ€ ๋” ๋†’์€ ์˜์—ญ์œผ๋กœ ์ด๋™ํ•˜๋ ค๋ฉด ์–ด๋А ๋ฐฉํ–ฅ์œผ๋กœ ์›€์ง์—ฌ์•ผ ํ•˜๋Š”์ง€๋ฅผ ๋‚˜ํƒ€๋‚ด๋Š” gradient๋ผ๊ณ  ์ดํ•ดํ•  ์ˆ˜ ์žˆ๋‹ค.

์ฆ‰, diffusion model์€ ๋‹จ์ˆœํžˆ denoising ๊ฒฐ๊ณผ๋ฅผ ์˜ˆ์ธกํ•˜๋Š” ๊ฒƒ๋ฟ๋งŒ ์•„๋‹ˆ๋ผ, ํ˜„์žฌ sample์„ data distribution์— ๋” ๊ฐ€๊นŒ์šด ๋ฐฉํ–ฅ์œผ๋กœ ์ด๋™์‹œํ‚ค๊ธฐ ์œ„ํ•œ score field๋ฅผ ์ œ๊ณตํ•  ์ˆ˜ ์žˆ๋‹ค.

Distribution Matching Distillation (DMD)

Distribution Matching Distillation (DMD)์€ ๋งŽ์€ denoising step์ด ํ•„์š”ํ•œ diffusion model์„ ์ ์€ step๋งŒ์œผ๋กœ generation์„ ์ˆ˜ํ–‰ํ•˜๋Š” generator๋กœ distillationํ•˜๊ธฐ ์œ„ํ•œ ๋ฐฉ๋ฒ•์ด๋‹ค.

๊ธฐ์กด diffusion teacher๊ฐ€

\[z \rightarrow x_{T-1} \rightarrow x_{T-2} \rightarrow \cdots \rightarrow x_0\]

์ฒ˜๋Ÿผ ์—ฌ๋Ÿฌ ๋ฒˆ์˜ denoising step์„ ๊ฑฐ์ณ sample์„ ์ƒ์„ฑํ•œ๋‹ค๋ฉด, DMD์˜ ๋ชฉ์ ์€ few-step student generator \(G_\theta\)๊ฐ€ ์ƒ์„ฑํ•˜๋Š” distribution์„ teacher์˜ target distribution๊ณผ ์ผ์น˜์‹œํ‚ค๋Š” ๊ฒƒ์ด๋‹ค.

์ฆ‰,

\[p_{\text{fake}} \rightarrow p_{\text{real}}\]

์ด ๋˜๋„๋ก student generator๋ฅผ ํ•™์Šตํ•œ๋‹ค.

์—ฌ๊ธฐ์„œ, \(p_{\text{real}}\)๋Š” teacher diffusion model์ด ํ‘œํ˜„ํ•˜๋Š” target distribution, $p_{\text{fake}}$๋Š” ํ˜„์žฌ student generator \(G_\theta\)๊ฐ€ ์ƒ์„ฑํ•˜๋Š” distribution

์„ ์˜๋ฏธํ•œ๋‹ค.

DMD์—์„œ๋Š” randomly sampled noise \(z\)๋ฅผ student generator์— ์ž…๋ ฅํ•˜์—ฌ

\[x_{\text{fake}} = G_\theta(z)\]

๋ฅผ ์ƒ์„ฑํ•˜๊ณ , ์—ฌ๊ธฐ์— ๋‹ค์‹œ timestep \(t\)์— ํ•ด๋‹นํ•˜๋Š” noise๋ฅผ ์ถ”๊ฐ€ํ•œ๋‹ค.

\[x_t = F(G_\theta(z),t)\]

์ด noisy sample์— ๋Œ€ํ•ด real distribution๊ณผ fake distribution ๊ฐ๊ฐ์˜ score๋ฅผ ๊ณ„์‚ฐํ•œ๋‹ค.

\[s_{\text{real}}(x_t,t) = \nabla_{x_t} \log p_{\text{real}}(x_t)\] \[s_{\text{fake}}(x_t,t) = \nabla_{x_t} \log p_{\text{fake}}(x_t)\]

DMD์˜ ํ•ต์‹ฌ gradient๋Š” ๋‹ค์Œ๊ณผ ๊ฐ™์ด ๋‘ score์˜ ์ฐจ์ด๋ฅผ ์ด์šฉํ•œ๋‹ค.

\[\nabla \mathcal{L}_{\mathrm{DMD}} = - \mathbb{E}_{t} \left[ \int \left( s_{\mathrm{real}} \left( F(G_\theta(z),t),t \right) - s_{\mathrm{fake}} \left( F(G_\theta(z),t),t \right) \right) \frac{dG_\theta(z)}{d\theta} \,dz \right]\]

์—ฌ๊ธฐ์„œ ํ•ต์‹ฌ์ ์ธ ๋ถ€๋ถ„์€

\[s_{\text{real}} - s_{\text{fake}}\]

์ด๋‹ค.

Score์˜ ์ •์˜๋ฅผ ์ด์šฉํ•˜๋ฉด

\[s_{\text{real}} - s_{\text{fake}} = \nabla_x\log p_{\text{real}}(x) - \nabla_x\log p_{\text{fake}}(x)\]

์ด๋ฏ€๋กœ,

\[s_{\text{real}} - s_{\text{fake}} = \nabla_x \log \frac{p_{\text{real}}(x)} {p_{\text{fake}}(x)}\]

๋กœ ๋ณผ ์ˆ˜ ์žˆ๋‹ค.

๋”ฐ๋ผ์„œ \(s_{\text{real}}-s_{\text{fake}}\)๋Š” ๋‹จ์ˆœํžˆ student์—๊ฒŒ loss๋ฅผ ์ „๋‹ฌํ•˜๊ธฐ ์œ„ํ•ด ์‚ฌ์šฉํ•˜๋Š” ๊ฒƒ์ด ์•„๋‹ˆ๋ผ, ํ˜„์žฌ student์˜ output distribution์ด real distribution๊ณผ ๋น„๊ตํ–ˆ์„ ๋•Œ ์–ด๋А ๋ฐฉํ–ฅ์œผ๋กœ ์ˆ˜์ •๋˜์–ด์•ผ ํ•˜๋Š”์ง€๋ฅผ ๋‚˜ํƒ€๋‚ด๋Š” gradient๋ผ๊ณ  ์ดํ•ดํ•  ์ˆ˜ ์žˆ๋‹ค.

์ด๋ฅผ ๋‹ค์‹œ

\[\frac{dG_\theta(z)}{d\theta}\]

๋ฅผ ํ†ตํ•ด generator parameter \(\theta\)๊นŒ์ง€ ์ „๋‹ฌํ•จ์œผ๋กœ์จ

\[p_{\text{fake}} \rightarrow p_{\text{real}}\]

์ด ๋˜๋„๋ก student generator๋ฅผ ํ•™์Šตํ•œ๋‹ค.

Real Score Model and Fake Score Model

DMD์—์„œ๋Š” \(s_{\text{real}}\)๊ณผ \(s_{\text{fake}}\)๋ฅผ ์ง์ ‘ ์•Œ ์ˆ˜ ์—†๊ธฐ ๋•Œ๋ฌธ์— ๊ฐ๊ฐ diffusion model์„ ์ด์šฉํ•˜์—ฌ score๋ฅผ ์ถ”์ •ํ•œ๋‹ค.

Real score์˜ ๊ฒฝ์šฐ pretrained diffusion model

\[\mu_{\text{real}}\]

์„ ์‚ฌ์šฉํ•œ๋‹ค.

$\mu_{\text{real}}$์€ target data distribution์— ๋Œ€ํ•ด ์ด๋ฏธ ํ•™์Šต๋˜์–ด ์žˆ์œผ๋ฏ€๋กœ training ๊ณผ์ •์—์„œ frozen ์ƒํƒœ๋กœ ์œ ์ง€๋œ๋‹ค.

๋ฐ˜๋ฉด fake distribution์€ student generator๊ฐ€ ํ•™์Šต๋  ๋•Œ๋งˆ๋‹ค ๊ณ„์† ๋ณ€ํ™”ํ•œ๋‹ค.

\[p_{\text{fake}}^{(0)} \neq p_{\text{fake}}^{(1)} \neq p_{\text{fake}}^{(2)} \neq \cdots\]

๋”ฐ๋ผ์„œ fake distribution์˜ score๋ฅผ ์ถ”์ •ํ•˜๋Š” ๋ณ„๋„์˜ diffusion model

\[\mu_{\text{fake}}\]

๊ฐ€ ํ•„์š”ํ•˜๋‹ค.

$\mu_{\text{fake}}$๋Š” ํ˜„์žฌ student generator๊ฐ€ ์ƒ์„ฑํ•œ sample๋“ค์„ ์ด์šฉํ•œ diffusion loss๋ฅผ ํ†ตํ•ด ์ง€์†์ ์œผ๋กœ update๋˜๋ฉฐ, ํ˜„์žฌ์˜

\[p_{\text{fake}}\]

๋ฅผ ์ถ”์ •ํ•˜๋„๋ก ํ•™์Šต๋œ๋‹ค.

์ „์ฒด์ ์ธ ๊ตฌ์กฐ๋Š” ๋‹ค์Œ๊ณผ ๊ฐ™์ด ์ƒ๊ฐํ•  ์ˆ˜ ์žˆ๋‹ค.

\[z \rightarrow G_\theta(z) \rightarrow F(G_\theta(z),t)\]

์ƒ์„ฑ๋œ noisy sample์€ ๋‘ score model์— ์ž…๋ ฅ๋œ๋‹ค.

\[F(G_\theta(z),t) \rightarrow \begin{cases} \mu_{\text{real}} \rightarrow s_{\text{real}} \\ \mu_{\text{fake}} \rightarrow s_{\text{fake}} \end{cases}\]

๊ทธ๋ฆฌ๊ณ 

\[s_{\text{real}}-s_{\text{fake}}\]

๋ฅผ ์ด์šฉํ•˜์—ฌ student generator \(G_\theta\)๋ฅผ updateํ•œ๋‹ค.

Why DMD Accelerates Inference

DMD์˜ ์ฃผ๋œ ๋ชฉ์ ์€ training ์ž์ฒด๋ฅผ ๋น ๋ฅด๊ฒŒ ํ•˜๋Š” ๊ฒƒ์ด ์•„๋‹ˆ๋ผ inference์— ํ•„์š”ํ•œ denoising step์„ ์ค„์ด๋Š” ๊ฒƒ์ด๋‹ค.

์ผ๋ฐ˜์ ์ธ multi-step diffusion teacher๊ฐ€

\[z \xrightarrow{\text{many denoising steps}} x\]

๋ฅผ ํ†ตํ•ด target distribution์˜ sample์„ ์ƒ์„ฑํ•œ๋‹ค๋ฉด, DMD๋Š” student๊ฐ€

\[z \xrightarrow{\text{few steps}} \hat{x}\]

๋งŒ์œผ๋กœ๋„

\[p(\hat{x}) \approx p(x)\]

๊ฐ€ ๋˜๋„๋ก ํ•™์Šตํ•œ๋‹ค.

์ฆ‰ teacher์˜ ๊ธด denoising trajectory๋ฅผ ๊ทธ๋Œ€๋กœ student๊ฐ€ ๋”ฐ๋ผ๊ฐ€๋Š” ๊ฒƒ์ด ์•„๋‹ˆ๋ผ, teacher๊ฐ€ ๋งŽ์€ denoising step์„ ํ†ตํ•ด ์ตœ์ข…์ ์œผ๋กœ ํ˜•์„ฑํ•˜๋Š” output distribution์„ few-step generator๊ฐ€ ์žฌํ˜„ํ•˜๋„๋ก ํ•™์Šตํ•˜๋Š” ๊ฒƒ์ด๋‹ค.

๋”ฐ๋ผ์„œ distillation training์—๋Š” real score model, fake score model, student generator ๋“ฑ์ด ํ•„์š”ํ•˜๊ธฐ ๋•Œ๋ฌธ์— ํ•™์Šต ๊ณผ์ • ์ž์ฒด๊ฐ€ ๋‹จ์ˆœํ•ด์ง€๋Š” ๊ฒƒ์€ ์•„๋‹ˆ์ง€๋งŒ, ํ•™์Šต์ด ์™„๋ฃŒ๋œ ๋’ค inference์—์„œ๋Š” teacher์™€ fake score model์ด ํ•„์š”ํ•˜์ง€ ์•Š์œผ๋ฉฐ few-step student๋งŒ ์‚ฌ์šฉํ•˜๋ฉด ๋œ๋‹ค.

์ •๋ฆฌํ•˜๋ฉด,

\[\boxed{ \text{DMD: Multi-step Teacher Distribution} \rightarrow \text{Few-step Student Generator} }\]

์ด๋ฉฐ, FlashWorld์—์„œ๋Š” ์ด๋Ÿฌํ•œ DMD๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ ๋†’์€ visual quality๋ฅผ ๊ฐ€์ง€๋Š” MV-oriented mode์˜ distribution์„ 3D consistency๋ฅผ ๊ฐ€์ง€๋Š” 3D-oriented few-step generator์— ์ „๋‹ฌํ•œ๋‹ค.

Method & Technical Details

ํ•ด๋‹น ๋…ผ๋ฌธ์˜ ๊ธฐ๋ฒ•์€ ์ž˜ train ๋˜๊ณ  high-quality multi-view ๋ฅผ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ๋Š” โ€œMV-oriented multi-view diffusion modelโ€๊ณผ few-step ๋งŒ์— 3D consistency๋ฅผ ๋ถ€์—ฌํ•˜๋Š” โ€œ3D-oriented generatorโ€๋ฅผ ์•ž์„œ ๋งํ•œ DMD ๊ธฐ๋ฒ•์„ ํ†ตํ•ด distillationํ•˜๋Š” ๊ฒƒ์ด ๋ชฉํ‘œ๋‹ค.

๊ทธ๋Ÿฌ๊ธฐ ์œ„ํ•ด์„œ๋Š” ์ €์ž๋“ค์€ ๋‘ ๊ฐ€์ง€ challenge๋ฅผ ํ•ด๊ฒฐํ•ด์•ผ ํ•œ๋‹ค๊ณ  ํ•œ๋‹ค:

  1. 3D-oriented few step generator๋Š” ์ถฉ๋ถ„ํžˆ robustํ•œ prior์™€ ๊ฐ•ํ•œ generative ๋Šฅ๋ ฅ์ด ํ•„์š”ํ•˜๋‹ค.
  2. high-quality multi-view dataset์€ ์ถฉ๋ถ„์น˜ ์•Š๊ธฐ ๋•Œ๋ฌธ์— ๊ธฐ์กด์˜ style, object, camera ๊ถค์ ๊ณผ ๊ฐ™์€ ๋ณ€์ˆ˜๋“ค์„ handling ํ•˜๋Š” ์ „๋žต์„ develop ํ•ด์•ผํ•œ๋‹ค.

Dual-mode Pre-training

์ด challenge๋“ค์„ ํ•ด๊ฒฐํ•˜๊ธฐ ์œ„ํ•œ ๊ธฐ๋ฐ˜์„ ๋‹ค์ง€๊ธฐ ์œ„ํ•ด framework๋ฅผ ๋จผ์ € ์ œ์•ˆํ•œ๋‹ค.

์—ฌ๊ธฐ์„œ dual-mode๋ž€ ์•„๋ž˜์˜ ๋‘ ๊ฐ€์ง€ ๋ชจ๋“œ๋ฅผ ์˜๋ฏธํ•œ๋‹ค:

  1. MV-oriented mode: multi-view image๋ฅผ ์˜ˆ์ธกํ•˜๋Š” ๊ฒƒ
  2. 3D-oriented mode: ์ค‘๊ฐ„ feature์—์„œ 3DGS๋ฅผ ์ง์ ‘ ๋งŒ๋“ค๊ณ  ๋ Œ๋”๋งํ•˜๋Š” ๊ฒƒ

๋จผ์ €, training dataset์—์„œ $X = {X_1, X_2, โ€ฆ , X_V}$ multi-view image๋“ค์„ ๊ฐ€์ ธ์˜จ๋‹ค. ๊ทธ๋ฆฌ๊ณ , $C={C_1, C_2, โ€ฆ , C_V}$ ๊ฐ view์— ํ•ด๋‹นํ•˜๋Š” camera parameter๋„ ๊ฐ€์ ธ์˜จ๋‹ค. ์ถ”๊ฐ€๋กœ, $y$๋ผ๋Š” condition(text prompt, single-view image ๋“ฑ)์ด ๋“ค์–ด๊ฐ„๋‹ค.

์ด๋ ‡๊ฒŒ ์ž…๋ ฅ์ด ์ค€๋น„๊ฐ€ ๋˜๋ฉด,

\[Z = E(X)\]

์ž…๋ ฅ multi-view images $X$๋ฅผ VAE encoder $E$์— ๋„ฃ์–ด์„œ latent๋กœ ๋ณ€ํ™˜ํ•œ๋‹ค. ๊ทธ๋Ÿฌ๋ฉด ์•„๋ž˜ ์ฒ˜๋Ÿผ multi-view data ํ•œ ๋ฐฐ์น˜์— ๋Œ€ํ•œ latent ์ง‘ํ•ฉ์ด ์™„์„ฑ๋œ๋‹ค:

\[Z = \{Z_1, Z_2, Z_2, ...\}\]

๊ทธ๋ฆฌ๊ณ  ๋‚˜์„œ, ์ผ๋ฐ˜์ ์ธ diffusion training์ฒ˜๋Ÿผ random timestep $t$๋ฅผ ์„ ํƒํ•˜๊ณ  noise๋ฅผ ๋„ฃ๋Š”๋‹ค.

\[Z_t = \alpha Z + \sigma_t \epsilon\]

์˜ˆ์ƒํ•  ์ˆ˜ ์žˆ๊ฒ ์ง€๋งŒ, ๊ทธ๋Ÿฌ๋ฉด ํ•™์Šต์œผ๋กœ ์‚ฌ์šฉ๋˜๋Š” ์ž…๋ ฅ multi-view image๊ฐ€ ์•„๋‹Œ noisy multi-view latent์ธ $Z_t$๋ฅผ ์‚ฌ์šฉํ•˜๊ฒŒ ๋œ๋‹ค. ๊ทธ๋Ÿฌ๋ฉด, denoising network์— ์ตœ์ข…์ ์œผ๋กœ ๋“ค์–ด๊ฐ€๋Š” ์ž…๋ ฅ์€:

\[(Z_t, C, y) \rightarrow \text{Denoising Network}\]

์ˆœ์„œ๋Œ€๋กœ, noisy latent, camera parameter, condition ์ด 3๊ฐœ๊ฐ€ ๋“ค์–ด๊ฐ€๊ฒŒ ๋œ๋‹ค. ์—ฌ๊ธฐ์„œ camera parameter๋ฅผ ํ‘œํ˜„ํ•˜๋Š” ๋ฐฉ์‹์—๋Š” Plรผcker Coordinates raymap๋ฅผ ์‚ฌ์šฉํ•˜๋ฉฐ, ์ด๋Š” 3D generation ๋ถ„์•ผ์—์„œ multi-view๋ฅผ ์ƒ์„ฑํ•  ๋•Œ camera parameter๋ฅผ ๋งŽ์ด ์‚ฌ์šฉ๋˜๋Š” ๋ฐฉ์‹์ด๋‹ค.

Denoising Network๋Š” Diffusion Transformer (DiT)๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ ํ•˜๋ฉฐ, 3D attention block์ด ์ถ”๊ฐ€์ ์œผ๋กœ ๋“ค์–ด๊ฐ„๋‹ค. ์ด network๋Š” ๋‘ ๊ฐ€์ง€ ๊ฒฐ๊ณผ๋ฅผ ์ถœ๋ ฅํ•˜๋ ค๊ณ  ํ•œ๋‹ค:

\[\hat{Z}_{MV}, F\]

์ˆœ์„œ๋Œ€๋กœ, clean multi-view latent(MV-oriented mode), multi-view scene information ์„ ๋‹ด๊ณ  ์žˆ๋Š” auxiliary feature ์ด๋‹ค. ์ด ์ค‘์—์„œ ํ›„์ž์˜ ๊ฒฝ์šฐ์—๋Š” ์ดํ›„์— 3DGS decoder๋กœ ๋ณด๋‚ด 3D Gaussian์„ ๋งŒ๋“ ๋‹ค(3D-oriented mode). ์ฆ‰, ์—ฌ๊ธฐ์„œ๋ถ€ํ„ฐ ๋‘ ๊ฐœ์˜ branch๋กœ ๋‚˜๋‰˜์–ด์„œ ์ง„ํ–‰๋œ๋‹ค.

๋จผ์ €, MV-oriented mode์˜ ๊ฒฝ์šฐ, DiT๊ฐ€ $Z_t, C, y$๋ฅผ ๋ฐ›์•„ $\hat{Z}_{MV}$๋ฅผ ์˜ˆ์ธกํ•œ๋‹ค. ๊ทธ๋ฆฌ๊ณ  ground-truth clean latent $Z$์™€ ๋น„๊ตํ•œ๋‹ค:

\[\mathcal{L}_{MV} = \mathbb{E}_{X, t, \epsilon, y, C} [\lVert Z - \hat{Z}_{MV} \rVert ^ 2]\]

์ฆ‰, noisy multi-view latent ๋ฅผ clean multi-view latent๋กœ ๋ณ€ํ™˜ํ•˜๋Š” ๊ฒƒ์„ ๋ฐฐ์šฐ๋Š” diffusion objective๋‹ค. ์ค‘์š”ํ•œ ๊ฑด, MV-oriented mode๊ฐ€ ์‹ค์ œ๋กœ ๋งŒ๋“œ๋Š” ๊ฑด 3D representation์ด ์•„๋‹ˆ๋‹ค. ๊ฐ camera view์— ํ•ด๋‹นํ•˜๋Š” ์ด๋ฏธ์ง€๋ฅผ ์ง์ ‘ ์ƒ์„ฑํ•˜๋Š” ๊ฒƒ์ด๋‹ค. ๊ทธ๋Ÿฌ๋ฏ€๋กœ, ๊ฐ view๊ฐ€ diffusion์— ์˜ํ•ด ์ด๋ฏธ์ง€ ๊ณต๊ฐ„์—์„œ ์ƒ์„ฑ๋˜๋ฏ€๋กœ, view 1๊ณผ view 2๊ฐ€ ๋™์ผํ•œ 3D geometry์—์„œ ๋‚˜์˜จ๋‹ค๊ณ  ๋ณด์žฅ๋˜์ง€ ์•Š๋Š”๋‹ค.

์ฆ‰, ์ˆœ์ˆ˜ diffusion์˜ ์ƒ์„ฑ ๋Šฅ๋ ฅ์— ๋”ฐ๋ผ high quality๋ฅผ ์ถœ๋ ฅํ•  ์ˆ˜ ์žˆ์ง€๋งŒ, multi-view inconsistency๋ผ๋Š” ๋ฌธ์ œ๊ฐ€ ์ƒ๊ธธ ์ˆ˜ ์žˆ๋‹ค.

์ด๋ฅผ ํ•ด๊ฒฐํ•˜๊ธฐ ์œ„ํ•ด ๋˜๋‹ค๋ฅธ branch์ธ 3D-oriented mode๊ฐ€ ๋“ฑ์žฅํ•œ๋‹ค. DiT์˜ intermediate/output feature์ธ $F$๋ฅผ ๋ณ„๋„์˜ 3DGS decoder $D_G$์— ๋„ฃ๋Š”๋‹ค:

\[D_G(F) = \{\tau, q, s, \alpha, c\}\]

decoder๊ฐ€ ๋‚ด๋†“๋Š” ๊ฒฐ๊ณผ๋Š” ์ˆœ์„œ๋Œ€๋กœ, depth, rotation quaternion, scale, opacity, spherical harmonics coefficients๋‹ค. ์ข€ ๋” ๊ฐ„๋‹จํ•˜๊ฒŒ, ๊นŠ์ด, ํšŒ์ „, ํฌ๊ธฐ, ๋ถˆํˆฌ๋ช…๋„, ์ƒ‰์ƒ์— ๊ด€๋ จํ•œ parameter๋ฅผ ๋‚ด๋†“๋Š”๋‹ค๊ณ  ์ƒ๊ฐํ•˜๋ฉด๋œ๋‹ค. ์ด๋Š” 3D Gaussian parameter๋ฅผ ์ œ๊ณตํ•œ๋‹ค๊ณ  ์ƒ๊ฐํ•˜๋ฉด ๋œ๋‹ค.

์šฐ๋ฆฌ๋Š” 3DGS์— ์ตํžˆ ์•Œ๊ณ  ์žˆ๋‹ค๋ฉด, ์›๋ž˜ ๋ณดํ†ต 3DGS primitives ๋ผ๊ณ  ํ•œ๋‹ค๋ฉด, gaussian์˜ position์ธ $\mu$๊ฐ€ ์žˆ์–ด์•ผ ํ•œ๋‹ค๋Š” ๊ฒƒ์„ ๋ˆˆ์น˜์ฑŒ ์ˆ˜ ์žˆ๋‹ค. ๊ทธ๋Ÿฐ๋ฐ ์œ„์˜ parameter ์ค‘์—๋Š” position์— ๊ด€๋ จํ•œ parameter๊ฐ€ ์—†๊ณ , ๋Œ€์‹  ๊ทธ ์ž๋ฆฌ์— depth $\tau$๊ฐ€ ์žˆ๋‹ค. ์ €์ž๋“ค์€ ์ด position์˜ parameter๋ฅผ ๋ฐ”๋กœ ์ •ํ•˜๋Š” ๋ฐฉ์‹์ด ์•„๋‹ˆ๋ผ ์ด depth๋ผ๋Š” parameter๋ฅผ ์‚ฌ์šฉํ•ด position parameter๋ฅผ ์˜ˆ์ธกํ•œ๋‹ค:

\[\mu = o + \tau d\]

์—ฌ๊ธฐ์„œ, $o$๋Š” camera origin(์นด๋ฉ”๋ผ ์œ„์น˜, ๋ณดํ†ต 3D ๊ณต๊ฐ„ ์ƒ์—์„œ ์›์ ), $d$๋Š” ray direction(์นด๋ฉ”๋ผ๊ฐ€ ๋ฐ”๋ผ๋ณด๋Š” ๋ฐฉํ–ฅ, ์ฆ‰ ์šฐ๋ฆฌ๊ฐ€ ๋ฐ”๋ผ๋ณด๋Š” ๋ฐฉํ–ฅ), $\tau$๋Š” ์˜ˆ์ธก๋œ depth๋ฅผ ์˜๋ฏธํ•œ๋‹ค. ๊ฐœ๋…์ ์œผ๋กœ, ํ•ด๋‹น ์ˆ˜์‹์ด ๊ฐ pixel ๋‹จ์œ„์—์„œ ์ผ์–ด๋‚˜๋ฉฐ, ๊ฐ ํ”ฝ์…€์— ๋Œ€์‘ํ•˜๋Š” 3D gaussian๋“ค์„ liftingํ•œ๋‹ค.

๊ทธ๋Ÿฌ๋ฉด, ์ตœ์ข…์ ์œผ๋กœ ์šฐ๋ฆฌ๊ฐ€ ํ•˜๋Š” Gaussian parameter๋ฅผ ์™„์„ฑํ•  ์ˆ˜ ์žˆ๋‹ค:

\[G = \{\mu, q, s, \alpha, c\}\]

๊ทธ๋Ÿฌ๋ฉด, ์šฐ๋ฆฌ๋Š” 3DGS renderer $R$๋ฅผ ์ด์šฉํ•ด์„œ ํ•ด๋‹น novel camera view์— ํ•ด๋‹นํ•˜๋Š” ์žฅ๋ฉด์„ rendering ํ•  ์ˆ˜ ์žˆ๋‹ค:

\[R(G, C_{novel})\]

๊ทธ๋Ÿฌ๋ฉด objective๊ฐ€ ๋ฌด์—‡์ธ์ง€๋ฅผ ์ƒ๊ฐํ•ด์•ผํ•œ๋‹ค. ์ •ํ™•ํ•˜๊ฒŒ๋Š” 3D Gaussian์— ๊ด€๋ จํ•œ ground-truth๊ฐ€ ์กด์žฌํ•˜๊ธฐ ํž˜๋“ค๋‹ค. depth๋ฅผ ์ถ”์ •ํ•˜๋Š” ๋ชจ๋ธ๋„ ๊ฐ๊ฐ์€ ๊ฐ ํ”ฝ์…€๋‹จ์œ„๋กœ depth๋ฅผ ๋‹ค๋ฅด๊ฒŒ ์ถ”์ •ํ•œ๋‹ค. ์‚ฌ์šฉํ•˜๋Š” depth model์ด ๋‹ฌ๋ผ depth ์ถ”์ •์ด ๋‹ค๋ฅด๋‹ค๋ฉด, ๊ทธ์— ๋”ฐ๋ผ ๊ฐ€์šฐ์‹œ์•ˆ์˜ position์€ ๋‹ฌ๋ผ์งˆ ๊ฒƒ์ด๋‹ค. ๊ทธ๋Ÿฐ๋ฐ, ๊ฒฐ๊ตญ์—๋Š” ์‚ฌ์šฉ์ž๊ฐ€ ์žฅ๋ฉด์„ ๋“ฃ๊ณ  3D์ฒ˜๋Ÿผ ๋ณด์ธ๋‹ค๋ผ๋Š” ๋А๋‚Œ์ด ๋“ค๋ฉด ๊ทธ๊ฒŒ ์ •๋‹ต์ด๋‹ค๋ผ๊ณ  ๋ณผ ์ˆ˜ ์žˆ๋Š” ๊ฒƒ์ด๋‹ค. ์ฆ‰, ํ•ด๋‹น ๊ด€๋ จํ•œ ํŒŒ๋ผ๋ฏธํ„ฐ๋“ค์˜ ground-truth๊ฐ€ ์—†๋‹ค:

\[\mu_{GT}, q_{GT}, s_{GT}\]

๊ทธ๋ž˜์„œ ๋Œ€๋ถ€๋ถ„์˜ 3D Generation ๋…ผ๋ฌธ๋“ค์€ ์ด rendering(ํŠน์ • view์— ๊ด€ํ•œ ์žฅ๋ฉด์„ ์บก์ฒ˜ํ•˜๋Š” ๊ฒƒ)์„ ์‚ฌ์šฉํ•ด์„œ rendering supervision์„ ์‚ฌ์šฉํ•œ๋‹ค:

\[\mathcal{L}_{3D} = \mathbb{E} [\lVert X_{novel} - R(G, C_{novel}) \rVert ^2]\]

์—ฌ๊ธฐ์„œ, ๋” ํŠน์ดํ•œ ์ ์€ ๋ณดํ†ต์˜ ๋…ผ๋ฌธ๋“ค์„ camera view๋“ค(pose 1 ~ pose n)์„ ํŒŒ์ดํ”„๋ผ์ธ ์‹คํ–‰ ์ „์— ์ •ํ•ด๋†“๊ณ , ํ•ด๋‹น view๋“ค์— ๊ด€ํ•ด์„œ๋งŒ supervision์„ ์ง„ํ–‰ํ•˜๋Š”๋ฐ ํ•ด๋‹น ๋…ผ๋ฌธ์˜ ๊ฒฝ์šฐ์—๋Š” ๋‹ค๋ฅธ ๋ฐฉ์‹์œผ๋กœ ์ ‘๊ทผํ•œ๋‹ค.

novel-view์—์„œ renderingํ•˜๊ณ  novel-view๋ฅผ ๋Œ€์ƒ์œผ๋กœ supervision์„ ์ง„ํ–‰ํ•œ๋‹ค.

์ด๋ ‡๊ฒŒ ํ•˜๋Š” ์ด์œ ๋Š” ์ž…๋ ฅํ•œ view์—์„œ๋งŒ reconstruction loss๋ฅผ ๊ฑธ๊ฒŒ ๋˜๋ฉด, ์ž…๋ ฅ view ์—์„œ๋งŒ ๋งž๊ฒŒ ๋ณด์ด๊ณ , ๋‹ค๋ฅธ view์—์„œ๋Š” 3D ๊ตฌ์กฐ๊ฐ€ ์ด์ƒํ•  ์ˆ˜ ์žˆ๋‹ค. ๊ทธ๋Ÿฌ๋‚˜ ์ž…๋ ฅ view ์ด์™ธ์˜ view์—์„œ๋„ ๋งž๊ฒŒ ๋ณด์ด๊ฒŒ novel-view reconstruction loss๋ฅผ ๊ฑธ๊ฒŒ ๋˜๋ฉด, ์—ฌ๋Ÿฌ ๊ด€์ ์—์„œ ์ผ๊ด€๋˜๊ฒŒ ๋ฐฐ์น˜๋˜์–ด์•ผ ํ•˜๋ฏ€๋กœ, 3D consistency constraint๊ฐ€ ์ƒ๊ธฐ๊ฒŒ ๋œ๋‹ค. ์—ฌ๊ธฐ์„œ, ์šฐ๋ฆฌ๋Š” ์ด์ „์— ์ •ํ•ด๋†“์€(training dataset์ด ์ •ํ•ด๋†“์€, ๋™์ผํ•œ Camera parameter $C$) ๊ฐ view์—์„œ 3D consistentํ•œ rendering multi-view๋ฅผ ์–ป๊ฒŒ ๋œ๋‹ค.

MV-oriented branch์—์„œ๋Š” ๊ฒฐ๊ณผ์ ์œผ๋กœ clean multi-view latent $\hat{Z}_{MV}$๋ฅผ ๋งŒ๋“ค์–ด๋ƒˆ๋‹ค. ํ•ด๋‹น 3D-oriented branch ์—์„œ๋Š” ๋น„์Šทํ•˜๊ฒŒ, $\hat{Z}_{3D}$๋ฅผ ๋งŒ๋“ค์–ด๋‚ธ๋‹ค. ์ด๋Š” rendering multi-view์— ๋‹จ์ˆœํžˆ VAE Encoder $E$๋ฅผ ๊ฑฐ์ณ ๋‚˜์˜จ latent๋‹ค:

\[\hat{Z}_{3D} = E(R(G, C))\]

cross-mode post-training

์ด์ œ ๋‹ค์Œ์œผ๋กœ ๋…ผ๋ฌธ์€ distillation ๋ฐฉ์‹์„ ํ†ตํ•ด few-step 3D Scene์„ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ๋„๋ก ํ•™์Šต์„ ํ•˜๋ ค๊ณ  ํ•œ๋‹ค.

์šฐ๋ฆฌ๋Š” ์•ž์„œ preliminary ์„น์…˜์—์„œ DMD์— ๋Œ€ํ•ด ๋ฐฐ์› ๊ณ , ๊ทธ์— ๋Œ€ํ•ด

\[\mu_{real}, \mu_{fake}, G_{\theta}\]

๊ฐ€ ์กด์žฌํ•œ๋‹ค๋Š” ๊ฒƒ์„ ์•Œ ์ˆ˜ ์žˆ์—ˆ๋‹ค. ์ด ํŒŒ์ดํ”„๋ผ์ธ์—์„œ๋Š” ๊ฐ๊ฐ MV-oriented mode(teacher), 3D student distribution์˜ fake score๋ฅผ ์ถ”์ •ํ•˜๋Š” model, 3D-oriented few-step generator(student)๋ผ๊ณ  ์ดํ•ดํ•˜๋ฉด ๋œ๋‹ค.

์—ฌ๊ธฐ์„œ $\mu_{real}$๋Š” frozen ๋œ ์ƒํƒœ๋กœ ์‚ฌ์šฉ๋œ๋‹ค. ์šฐ๋ฆฌ๋Š” ์•ž์„œ 3D-oriented mode์—์„œ ๋งŽ์€ step์œผ๋กœ ๋Œ๋ ธ๋Š”๋ฐ, ์ด๋ฅผ ๊ทธ๋Œ€๋กœ ์—ฌ๊ธฐ์„œ ๋งŽ์€ step์œผ๋กœ ๋Œ๋ฆฌ๋Š” ๊ฒƒ์ด ์•„๋‹ˆ๋ผ, ์•ž์˜ 3D-oriented mode๋ฅผ ์ง€๊ธˆ few-step student์˜ initialization์œผ๋กœ ์‚ฌ์šฉํ•œ๋‹ค. ์ฆ‰, ์ „์˜ dual-mode pretraining ์„น์…˜์—์„œ์˜ architecture์— ๋‹ค๋ฅธ architecture๊ฐ€ ์ƒˆ๋กœ ์ถ”๊ฐ€๋˜๋Š”๊ฒŒ ์•„๋‹ˆ๋‹ค.

๋…ผ๋ฌธ์€ ์ด์ „ ์„น์…˜์˜ 3D-oriented mode์˜ ํŒŒ์ดํ”„๋ผ์ธ์„ ๊ฑฐ์˜ ๊ทธ๋Œ€๋กœ ๋ฌผ๋ ค ๋ฐ›๋Š”๋‹ค:

\[(\{Z_{t_i}, t_i, y, C\} \rightarrow DiT \rightarrow F_i \rightarrow D_G \rightarrow G_i) \rightarrow R(G_i,C) \rightarrow E(R(G_i,C)) \rightarrow \text{noise injection} \rightarrow Z_{t_{i+1}}\]

์—ฌ๊ธฐ์„œ, ๊ด„ํ˜ธ ์•ˆ์— ์žˆ๋Š” ํŒŒ์ดํ”„๋ผ์ธ์ด 3D-oriented generation process์˜ denoising $G_{\theta, 3D}$์ด๋ผ๊ณ  ๋ณด๋ฉด ๋˜๊ณ , ์ด๊ฑธ 4๋ฒˆ์˜ step ๋งŒ์— ์ฒ˜๋ฆฌํ•˜๋Š” ๊ฑธ ๋ชฉํ‘œ๋กœ ํ•œ๋‹ค. ์—ฌ๊ธฐ์„œ ํ—ท๊ฐˆ๋ฆฌ๋ฉด ์•ˆ๋˜๋Š” ๊ฒƒ์ด DiT์˜ timestep์ด 4๋ผ๋Š”๊ฒŒ ์•„๋‹ˆ๋ผ, ํ•ด๋‹น ํ”„๋กœ์„ธ์Šค๊ฐ€ 4๋ฒˆ์˜ ํšŸ์ˆ˜๋กœ ์ง„ํ–‰๋˜๋Š” ๊ฒƒ์„ ๋งํ•œ๋‹ค. ํ•ด๋‹น ๋…ผ๋ฌธ์—์„œ๋Š” timestep์ด $t_i={1000, 900, 759, 500}$ ์œผ๋กœ ์ด๋ฃจ์–ด์ ธ ์žˆ๋‹ค๊ณ  ํ•œ๋‹ค. ํ•ด๋‹น ํ”„๋กœ์„ธ์Šค์˜ step ํ•œ ๋ฒˆ์˜ ๋์—๋Š” ๋งค๋ฒˆ noise injection์ด ์ˆ˜ํ–‰๋˜๊ณ , ์ด๋ฅผ ๋‹ค์Œ step $t_{i+1}$์— ๋„˜๊ฒจ์ค€๋‹ค.

์ด๋ ‡๊ฒŒ ํŒŒ์ดํ”„๋ผ์ธ์˜ ํ๋ฆ„์„ ์ •ํ•ด๋†“๊ณ , DMD2 ๊ธฐ๋ฒ•์„ ์‚ฌ์šฉํ•œ๋‹ค. ์›๋ž˜ 3D-oriented branch ์—์„œ๋Š” many step์„ ์‚ฌ์šฉํ–ˆ๋Š”๋ฐ, ๋ฐ”๋กœ 4-step branch๋กœ ๋ฐ”๊ฟ”๋ฒ„๋ฆฌ๊ฒŒ ๋˜๋ฉด, quality๊ฐ€ ๋ณด์žฅ๋˜์ง€ ์•Š๋Š”๋‹ค. ๊ทธ๋ž˜์„œ ์ด few-step student๋ฅผ ๋‹ค์‹œ ํ•™์Šตํ•ด์„œ few-step์œผ๋กœ๋„ ์ข‹์€ output distribution์— ๋„๋‹ฌํ•  ์ˆ˜ ์žˆ๋„๋ก ํ•™์Šตํ•ด์•ผํ•œ๋‹ค.

์—ฌ๊ธฐ์„œ ์ด์ œ frozen๋œ high-quality MV distribution์˜ score์ธ $s_{real}$์„ ์ถ”์ •ํ•˜๋Š” $\mu_{real}$์„ ์‚ฌ์šฉํ•˜์—ฌ teacher model๋กœ ์‚ฌ์šฉํ•œ๋‹ค. ๊ทธ๋ฆฌ๊ณ , $\mu_{fake}$๋Š” student์ธ $G_{\theta, 3D}$๋ฅผ ๊ณ„์† ์ถ”์ ํ•˜๋ฉด์„œ student๊ฐ€ ์ƒ์„ฑํ•˜๋Š” distribution์ธ $p_{fake}$์˜ score์ธ $s_{fake}$๋ฅผ ์ถ”์ •ํ•œ๋‹ค. ๋‹น์—ฐํžˆ student๊ฐ€ ๋ฐ”๋€” ๋•Œ๋งˆ๋‹ค $p_{fake}$๋„ ๋ฐ”๋€Œ๋ฏ€๋กœ $\mu_{fake}$๋„ ๊ณ„์† update ๋œ๋‹ค.

์ฆ‰,

\[s_{MV} - s_{\text{current 3D student}} = s_{real} - s_{fake}\]

์ด gradient๋ฅผ ์‚ฌ์šฉํ•ด์„œ $G_{\theta, 3D}$๋ฅผ updateํ•œ๋‹ค. ์ด๋ ‡๊ฒŒ ๋˜๋ฉด,

\[p_{\text{3D student}} \rightarrow p_{MV}\]

๊ฐ€ ๋˜๋„๋ก ํ•œ๋‹ค. ์ถ”๊ฐ€์ ์œผ๋กœ DMD2 loss๋Š” DMD loss์— GAN loss๋ฅผ ํ•ฉํ•œ ๋ฒ„์ „์ด๋‹ค:

\[L_{DMD2} \approx L_{DMD}+\lambda_{GAN}L_{GAN}\]

์—ฌ๊ธฐ์„œ, $\lambda$๋Š” R1 regularization์ด๋‹ค. ๊ฐœ๋…์ ์œผ๋กœ discriminator๋Š”

\[D(X_{real}) \rightarrow 1 D(X_{fake}) \rightarrow 0\]

๊ฐ€ ๋˜๋„๋ก ํ•™์Šต๋˜๊ณ , generator $G_{\theta, 3D}$๋Š”

\[D(X_{fake}) \rightarrow 1\]

์ด ๋˜๋„๋ก ํ•™์Šต๋œ๋‹ค.

๊ทธ๋Ÿฐ๋ฐ, ๋ฌธ์ œ๋Š” ์ด๋ ‡๊ฒŒ ๋˜๋ฉด ๊ฒฐ๊ตญ์— 3D student๊ฐ€ 3d consistency์— ๋Œ€ํ•œ ๊ฐ•์ ์„ ์žƒ์–ด๋ฒ„๋ฆฌ๊ณ  MV-oriented ์ชฝ์œผ๋กœ ๋Œ๋ ค๊ฐˆ ์œ„ํ—˜์„ฑ์ด ์žˆ๋‹ค๋Š” ๊ฒƒ์ด๋‹ค. ๋ฌผ๋ก , 3d-oriented branch๋Š” ํ•˜๋‚˜์˜ share๋œ 3D Scene์—์„œ ๋ Œ๋”๋ง๋˜์–ด ์ด gradient๊ฐ€ update์˜ ์ฃผ์ฒด๊ฐ€ ๋˜์–ด 3d consistency๋ฅผ ์œ ์ง€ํ•  ๊ฒƒ์ฒ˜๋Ÿผ ๋ณด์ธ๋‹ค.

๋…ผ๋ฌธ์˜ ์ €์ž๋“ค์„ ์•„๋ž˜์˜ 3๊ฐœ์˜ ์ด์œ ๋กœ 3d consistency๊ฐ€ ์œ ์ง€๋œ๋‹ค๊ณ  ๋งํ•˜์ง€๋งŒ, ํ•ด๋‹น ๋ฆฌ๋ทฐ๋ฅผ ์ ๋Š” ๋ณธ์ธ์€ ํ•ด๋‹น ์ด์œ ๋งŒ์œผ๋กœ ์ฆ๋ช…๋˜๊ธฐ๋Š” ํž˜๋“ค๋‹ค๊ณ  ๋ณธ๋‹ค:

  1. 3D supervision (์ด์ „ ์„น์…˜์—์„œ novel-view์— ๋Œ€ํ•œ rendering supervision์„ ์ˆ˜ํ–‰ํ•˜๋Š” ๊ฒƒ)
  2. pretrained 3D-oriented weights๋กœ ์‹œ์ž‘ํ•˜๋Š” ๊ฒƒ
  3. ๋งค step ๋งˆ๋‹ค ๊ณ„์† $G_i \rightarrow \text{Render}$ ํ•˜๋Š” ๊ฒƒ

์—ฌ๊ธฐ์„œ ์ด ๋…ผ๋ฌธ์˜ ๋ฆฌ๋ทฐ๋ฅผ ์ ๋Š” ์ž‘์„ฑ์ž๊ฐ€ ์ƒ๊ฐํ•˜๊ธฐ์— 2๋ฒˆ์ด ์ค‘์š”ํ•ด ๋ณด์ด๋Š”๋ฐ, ์ด weights๊ฐ€ ๊ฒฐ๊ตญ์—๋Š” MV-oriented weights๋กœ ๊ณ„์† ๋ณ€ํ™”ํ• ํ…๋ฐ, ๊ทธ๋Ÿฌ๋ฉด 3d consistency์˜ ๊ฐ•์ ์„ ์–ด๋–ป๊ฒŒ ์•ˆ ์žƒ์–ด๋ฒ„๋ฆฌ๊ณ  ์œ ์ง€ํ•  ์ง€ ์˜๋ฌธ์ด๋‹ค. MV์ชฝ์€ ๊ณ ์ •๋˜์–ด ์žˆ๋Š” ์ƒํƒœ์—์„œ 3D์ชฝ๋งŒ updateํ•˜์—ฌ ์ง„ํ–‰ํ•˜๋Š” ๋ฐฉ์‹์ด๊ธฐ ๋•Œ๋ฌธ์ด๋‹ค.

์ถ”๊ฐ€์ ์œผ๋กœ ์ €์ž๋“ค์€ Cross-Mode Consistency Loss๋ฅผ ์ถ”๊ฐ€ํ•œ๋‹ค. ์—ฌ๊ธฐ์„œ, 3D Student๊ฐ€ ์‚ฌ์šฉํ•˜๋Š” DiT backbone์„ ๊ณต์œ ํ•˜๋Š” MV_oriented student branch๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค.

\[\begin{aligned} \hat{Z}_{3D} &= E(R(G_{\theta, 3D}(Z_t, t_i, y, C), C)) \\ \hat{Z}_{MV} &= G_{\theta, MV}(Z_t, t_i, y, C) \end{aligned}\]

๋ฅผ ์–ป์–ด์„œ

\[\mathcal{L}_{CMC} = \lVert \hat{Z}_{3D} - \hat{Z}_{MV} \rVert ^2\]

๋กœ ๋งž์ถ˜๋‹ค. ์ด๋Š” DMD2๋ฅผ ์ง„ํ–‰ํ–ˆ์„ ๋•Œ ์ƒ๊ธฐ๋Š” floating artifact์™€ ๋ถˆ์•ˆ์ •ํ•œ 3D prediction์„ ์ค„์ด๊ธฐ ์œ„ํ•œ ๋ณด์กฐ loss๋กœ MV-oriented student๋„ ๋‚ฎ์€ frequency๋กœ ์–ด๋ฐ์ดํŠธํ•˜๊ณ , ๋‘ mode์˜ prediction์„ ๋งž์ถ˜๋‹ค.

๊ฒฐ๋ก ์ ์œผ๋กœ, 3D student๋Š” ํ•ด๋‹น signal์„ ๋ฐ›๊ฒŒ ๋œ๋‹ค:

\[\underbrace{\mathcal{L}_{\mathrm{DMD}}}_{\text{MV teacher distribution์œผ๋กœ ์ด๋™}} + \underbrace{\mathcal{L}_{\mathrm{GAN}}}_{\text{rendering์„ real/high-qualityํ•˜๊ฒŒ}} + \underbrace{\lambda \mathcal{L}_{\mathrm{CMC}}}_{\text{3D branch ์•ˆ์ •ํ™”}}\]

Out-of-Distribution Data Co-Training

์ด๋ ‡๊ฒŒ ํ•™์Šต์„ ์ง„ํ–‰ํ•˜๊ฒŒ ๋˜๋ฉด, ํ•˜๋‚˜์˜ ์‚ฌ์†Œํ•œ ๋ฌธ์ œ๊ฐ€ ๋˜ ๋ฐœ์ƒํ•˜๊ฒŒ ๋œ๋‹ค. Flashworld์˜ ๊ฒฝ์šฐ, MVImgNet, RealEstate10K, DL3DV10K๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ ํ•™์Šต๋˜์—ˆ๋‹ค. ๊ทธ๋Ÿฐ๋ฐ, DiT์˜ ๊ฒฝ์šฐ์—๋Š” ์ด ์ด์™ธ์—๋„ ๋Œ€๊ทœ๋ชจ image์™€ video data๋กœ ํ•™์Šต๋˜์—ˆ๊ธฐ ๋•Œ๋ฌธ์— ์•ž์˜ 3๊ฐœ์˜ multi-view datasets์„ ์ œ์™ธํ•œ ๋‹ค๋ฅธ ๋ฐ์ดํ„ฐ๊ฐ€ ๋“ค์–ด์™€๋„ robustํ•˜๊ฒŒ ๋Œ€์ฒ˜ํ•  ์ˆ˜ ์žˆ๋Š” ๋ฐ˜๋ฉด, 3D branch์— ์žˆ๋Š” 3DGS Decoder๋Š” 3๊ฐœ์˜ multi-view datasets์„ ์ œ์™ธํ•œ ๋‹ค๋ฅธ ๋ฐ์ดํ„ฐ์— ๋Œ€ํ•ด robust ํ•˜์ง€์•Š๋‹ค.

์ฆ‰, 3DGS Decoder $D_G$๋Š” multi-view distribution๋งŒ ๊ฒฝํ—˜ํ–ˆ๋‹ค.

๊ทธ๋ ‡๋‹ค๋ฉด 3DGS Decoder๊ฐ€ ๋ฐ›์€ input์˜ distribution์„ ๋„“ํ˜€์ฃผ๋ฉด ํ•ด๊ฒฐ๋œ๋‹ค. ๊ทธ๋Ÿฌ๊ธฐ ์œ„ํ•ด์„œ, ๋จผ์ € ํ•ด๋‹น ํŒŒ์ดํ”„๋ผ์ธ์—์„œ ์ฒ˜์Œ์— ์ž…๋ ฅํ•˜๋Š” ๋ฐ์ดํ„ฐ๋ฅผ multi-view dataset์ด ์•„๋‹ˆ๋ผ single image๋‚˜ text๋งŒ ๋„˜๊ฒจ์ฃผ๊ฒŒ ๋œ๋‹ค.

text ํ˜น์€ single image $y$๋งŒ ๋„˜๊ฒจ์ฃผ๋Š” ๊ฒฝ์šฐ์—๋Š” ์ด์— camera trajectory $C$๋ฅผ ๊ฐ™์ด ๋„˜๊ฒจ์ฃผ๊ณ , DMD ๋ฐฉ์‹์œผ๋กœ๋งŒ ํ•™์Šต์„ ์ง„ํ–‰ํ•˜๊ฒŒ ๋œ๋‹ค. ๋‹น์—ฐํžˆ ์‹ค์ œ Ground truth๊ฐ€ ์—†์œผ๋ฏ€๋กœ GAN Loss๋Š” ์‚ฌ์šฉํ•˜์ง€ ์•Š๊ณ  DMD์™€ CMC loss ๋งŒ์œผ๋กœ ํ•™์Šต์„ ์ง„ํ–‰ํ•œ๋‹ค:

\[(y, C_{random}) \rightarrow DiT \rightarrow F \rightarrow D_G \rightarrow G\]

์—ฌ๊ธฐ์„œ Camera trajectory๋Š” RealEstate10K, WorldScore ๊ฐ™์€ ์ด๋ฏธ ์žˆ๋Š” multi-view dataset์˜ trajectory๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค. ๊ทธ๋ฆฌ๊ณ , ํ•ด๋‹น ํ•™์Šต์€ pre-training ๋‹จ๊ณ„๊ฐ€ ์•„๋‹Œ post-training ๋‹จ๊ณ„์—์„œ multi-view data์™€ ood data๋ฅผ 2:1์˜ ๋น„์œจ๋กœ ์„ž์–ด์„œ ์‚ฌ์šฉํ•œ๋‹ค.

Experiments

figure 4 ์—์„œ๋Š” baseline๋“ค์„ MV-oriented ๋ฐฉ์‹๋“ค๋กœ ๊ตฌ์„ฑํ•˜๊ณ , 3D oriented ํŒŒ์ดํ”„๋ผ์ธ์ธ flashworld์˜ ๊ฐ•์ ์„ ๋ณด์—ฌ์ค€๋‹ค. ํ•ด๋‹น ๋ฒ ์ด์Šค๋ผ์ธ๋“ค์€ ์ฝ”๋“œ๊ฐ€ ์˜คํ”ˆ๋˜์–ด ์žˆ์ง€ ์•Š์ง€๋งŒ, ๊ฐ ํ”„๋กœ์ ํŠธ ํŽ˜์ด์ง€์— ์ œ๊ณต๋œ ๋น„๋””์˜ค ๊ฒฐ๊ณผ๋ฌผ์„ ํ™œ์šฉํ•˜๊ณ , ViPE๋ผ๋Š” ๋ชจ๋ธ์„ ์‚ฌ์šฉํ•ด์„œ ์นด๋ฉ”๋ผ ํฌ์ฆˆ์™€ ๋‚ด์žฌ ํŒŒ๋ผ๋ฏธํ„ฐ๋ฅผ ์ถ”์ •ํ•˜์—ฌ ์ตœ๋Œ€ํ•œ ๋น„์Šทํ•œ ๊ฐ๋„์—์„œ ์ƒ์„ฑํ•˜๋„๋ก ํ•˜์˜€๋‹ค.

ํ…์ŠคํŠธ ๊ธฐ๋ฐ˜ ์ƒ์„ฑ ๋น„๊ต์— ๋Œ€ํ•ด์„œ๋Š” ์ •์„ฑํ‰๊ฐ€์™€ ์ •๋Ÿ‰ํ‰๊ฐ€๋ฅผ ๋ชจ๋‘ ์ง„ํ–‰ํ•˜์˜€๋‹ค. ์ •์„ฑํ‰๊ฐ€์—์„œ Prometheus๋Š” MV-oriented ํŒŒ์ดํ”„๋ผ์ธ์˜ ๋ณธ์งˆ์ ์ธ ๋ถˆ์ผ์น˜๋กœ ์ธํ•ด ์ƒ์„ฑ๋œ ์žฅ๋ฉด์ด ์ž์ฃผ ํ๋ฆฟํ•ด์ง€๊ณ  ๊ธฐํ•˜ ๊ตฌ์กฐ๊ฐ€ ์ž˜๋ชป ํ‘œํ˜„๋˜๊ธฐ๋„ ํ•œ๋‹ค. ๊ทธ๋ฆฌ๊ณ , SplatFlow์™€ VideoRFSplat ์—ญ์‹œ ํ๋ฆฟํ•œ ์™œ๊ณก์œผ๋กœ ์–ด๋ ค์›€์„ ๊ฒช์œผ๋ฉฐ ๋ฐ”๋‹ฅ์ด๋‚˜ ์ž”๋”” ๋“ฑ์—์„œ ๋ฐœ๊ฒฌ๋˜๋Š” ์„ธ๋ถ€์ ์ธ ๋””ํ…Œ์ผ์„ ์žฌํ˜„ํ•˜๋Š”๋ฐ ํ•œ๊ณ„๋ฅผ ๋ณด์ธ๋‹ค.

์ •๋Ÿ‰ํ‰๊ฐ€์˜ ๊ฒฝ์šฐ์—๋Š” T3Bench, DL3DV, WorldScore์—์„œ 600๊ฐœ์˜ ํ…์ŠคํŠธ ํ”„๋กฌํฌํŠธ๋ฅผ ์ƒ˜ํ”Œ๋งํ•˜์˜€๋‹ค. ํ•ด๋‹น table์—์„œ ๋น„๊ต ๋Œ€์ƒ์ด ๋˜๋Š” ๋ฐฉ๋ฒ•๋“ค์ด 3D Gaussian representation์„ ๊ธฐ๋ฐ˜์œผ๋กœ ํ•˜๊ธฐ ๋•Œ๋ฌธ์—, ์นด๋ฉ”๋ผ ์ œ์–ด ๋ฐ 3d consistency๊ณผ ๊ด€๋ จ๋œ ์ง€ํ‘œ๋“ค์€ ๋ณธ ์‹คํ—˜ ์„ค์ •์—์„œ ์ ์šฉํ•˜๊ธฐ ์ ํ•ฉํ•˜์ง€ ์•Š์•„์„œ CLIP IQA+, CLIP Aesthetic, CLIP Score, Q-Align์„ ํฌํ•จํ•˜์—ฌ ํ‰๊ฐ€ ์ง€ํ‘œ์— ์ง‘์ค‘ํ–ˆ๋‹ค. ํŠนํžˆ, CLIP-Aesthetic ์ง€ํ‘œ์˜ ๊ฒฝ์šฐ, ๋•Œ๋•Œ๋กœ smooth ์ถœ๋ ฅ๋ฌผ์„ ์„ ํ˜ธํ•˜๋Š” ๊ฒฝํ–ฅ์ด ์žˆ์–ด ๋ณธ ์—ฐ๊ตฌ ๋ฐฉ๋ฒ•์ด ๋งŒ๋“ค์–ด๋‚ด๋Š” ์ •๊ตํ•˜๊ณ  ์‚ฌ์‹ค์ ์ธ ๊ฒฐ๊ณผ์™€ ํ•ญ์ƒ ๋ถ€ํ•ฉํ•˜์ง€ ์•Š์„ ์ˆ˜ ์žˆ์Œ์„ ์•Œ ์ˆ˜ ์žˆ๋‹ค.

๋…ผ๋ฌธ์˜ ์ €์ž๋“ค์€ worldscore benchmark์— ๋Œ€ํ•ด์„œ๋„ ํ‰๊ฐ€๋ฅผ ์ง„ํ–‰ํ•œ๋‹ค. Flashworld๋Š” WonderJourney, LucidDreamer, WonderWorld 3D ์ƒ์„ฑ ๋ฐฉ๋ฒ•๋ก ๋“ค๊ณผ ๋น„๊ตํ•œ๋‹ค. ์—ฌ๊ธฐ์„œ ํ•ด๋‹น ์—ฐ๊ตฌ์—์„œ 3D ์ƒ์„ฑ ๋ฐฉ๋ฒ•๋ก ์—๋งŒ ์ง‘์ค‘ํ•˜๊ณ  ์žˆ์–ด, Camera Control ์ด๋ผ๋Š” ์ง€ํ‘œ๋Š” ์ฃผ๋กœ ๊ฐ ๋ฐฉ๋ฒ•๋ก ์˜ ํ‰๊ฐ€ ํ”„๋กœํ† ์ฝœ์— ๋Œ€ํ•œ ๊ฐ•๊ฑด์„ฑ๋งŒ์„ ๋ฐ˜์˜ํ•  ๋ฟ์ด์–ด์„œ ๋ณธ ์‹คํ—˜ ์„ธํŒ…์—์„œ๋Š” informative๊ฐ€ ๋–จ์–ด์ ธ ํ•ด๋‹น ์ง€ํ‘œ๋Š” ํฌํ•จํ•˜์ง€ ์•Š์•˜๋‹ค. ๋˜ํ•œ, ๊ธฐ์กด WorldScore ๋ฒค์น˜๋งˆํฌ๋Š” ๋Œ€๋ถ€๋ถ„์˜ ์ง€ํ‘œ๋ฅผ anchor frames์—์„œ๋งŒ ํ‰๊ฐ€ํ•˜๋Š”๋ฐ, ์ด๋Š” novel view synthesis๊ฐ€ ์š”๊ตฌ๋˜๋Š” 3D ์›”๋“œ ์ƒ์„ฑ ๊ณผ์—…์— suboptimal ์ผ ์ˆ˜ ์žˆ๋‹ค.

๊ทธ๋ž˜์„œ ๋”์šฑ ๊ณต์ •ํ•œ ๋น„๊ต๋ฅผ ์œ„ํ•ด ํŠน์ • interval ์•ˆ์— ์žˆ๋Š” ํ”„๋ ˆ์ž„๋“ค ์ค‘์— ๋ฌด์ž‘์œ„๋กœ ํ”„๋ ˆ์ž„๋“ค์„ ๋ฝ‘์•„๋‚ด์–ด์„œ ์žฌํ‰๊ฐ€ํ–ˆ๋‹ค๊ณ  ํ•œ๋‹ค. ๋ชจ๋“  ์ ‘๊ทผ ๋ฐฉ์‹ ์ค‘์—์„œ ๊ฐ€์žฅ ๋†’์€ ํ‰๊ท  ์ ์ˆ˜์™€ ๊ฐ€์žฅ ๋น ๋ฅธ ์ถ”๋ก  ์†๋„๋ฅผ ๋‹ฌ์„ฑํ•˜์˜€๋‹ค.

๊ทธ๋ฆฌ๊ณ  ๋…ผ๋ฌธ์˜ ์ €์ž๋“ค์€ ๋‹ค์–‘ํ•œ ablation study๋ฅผ ์ง„ํ–‰ํ•˜์˜€๋‹ค. w/ MV-Diff์˜ ๊ฒฝ์šฐ MV-oriented diffusion model์„ ์˜๋ฏธํ•˜๊ณ , w/ 3D-Diff์˜ ๊ฒฝ์šฐ 3D oriented diffusion model์„ ์˜๋ฏธํ•˜๊ณ , w/ MV-Dist์˜ ๊ฒฝ์šฐ MV-oriented model์„ few-step์œผ๋กœ distillํ•œ ๊ฒฝ์šฐ๋ฅผ ์˜๋ฏธํ•˜๊ณ , w/o CMC์˜ ๊ฒฝ์šฐ์—๋Š” 3D-oriented model์„ few-step์œผ๋กœ distillํ•˜์ง€๋งŒ CMC loss๊ฐ€ ์ œ๊ฑฐ๋œ ๊ฒฝ์šฐ, ๋งˆ์ง€๋ง‰์œผ๋กœ w/o OOD์˜ ๊ฒฝ์šฐ์—๋Š” Full cross-mode model์—์„œ OOD co-training์„ ์ œ๊ฑฐํ•œ ๊ฒฝ์šฐ๋ฅผ ๋ณด์—ฌ์ค€๋‹ค.

์ •๋ง ์‹ ๊ธฐํ•˜๊ฒŒ๋„, full model์— ๋น„ํ•ด์„œ w/o CMC์˜ ๊ฒฝ์šฐ์—์„œ ๋งŽ์€ metric์ด ๋” ์šฐ์ˆ˜ํ•œ ๊ฒฝ์šฐ๋“ค์„ ๋ณด์—ฌ์ค€๋‹ค. ์ด๋Š” ๋‹จ์ˆœํžˆ CMC๊ฐ€ ์•„๊นŒ ๋งํ–ˆ๋“ฏ์ด 3D student model์ด 3D consistency์— ๋Œ€ํ•œ distribution์„ ์žŠ๋Š” ๊ฒƒ์„ ๋„˜์–ด์„œ ์ฆ๋ช…๋„ ํž˜๋“ฌ์„ ๋ณด์—ฌ์ฃผ๋Š” ๊ฒƒ ๊ฐ™๋‹ค.

Contributions

  1. MV-oriented ๋ฐฉ์‹๊ณผ 3D-oriented ๋‘ ๋ฐฉ์‹ ๋ชจ๋‘์—์„œ ์ž‘๋™ํ•˜๋Š” multi-view diffusion model์„ ํ•™์Šตํ•˜๋Š” pretraining strategy๋ฅผ ์†Œ๊ฐœํ•œ๋‹ค.
  2. visual quality, 3d consistency ๋ชจ๋‘์—์„œ robustํ•œ ์„ฑ๋Šฅ์„ ๋ณด์—ฌ์ฃผ๋Š” cross-mode post-training strategy๋ฅผ ์ œ์•ˆํ•œ๋‹ค.
  3. out-of-distribution์—์„œ generalization ability๋ฅผ ๋†’์ด๋Š” novel strategy๋ฅผ ์†Œ๊ฐœํ•œ๋‹ค.

Limitations & Future works

view์˜ ์ˆ˜๋ฅผ ๋Š˜๋ ธ์Œ์—๋„, ์ƒ์„ฑ๋˜๋Š” 3D ์žฅ๋ฉด์˜ ๋‹ค์–‘์„ฑ๊ณผ ๊ทœ๋ชจ๋Š” ์—ฌ์ „ํžˆ ๊ธฐ์กด์— ์กด์žฌํ•˜๋Š” ๋ฐ์ดํ„ฐ์…‹์˜ ์ปค๋ฒ„๋ฆฌ์ง€ ๋ฒ”์œ„์— ์˜ํ•ด ์ œํ•œ๋œ๋‹ค. ์ •๋ฐ€ํ•œ ๊ธฐํ•˜ ๊ตฌ์กฐ๋‚˜ ๊ฑฐ์šธ ๋ฐ˜์‚ฌ, ๊ธ€์”จ์™€ ๊ฐ™์€ ์„ธ๋ฐ€ํ•œ ํ‘œํ˜„์—๋Š” ํ•œ๊ณ„๋ฅผ ์ง€๋‹Œ๋‹ค. ์ž๊ธฐํšŒ๊ท€ ์ƒ์„ฑ๊ธฐ๋ฒ•์˜ ๋„์ž…๊ณผ ๋™์  4D ์žฅ๋ฉด ์ƒ์„ฑ์œผ๋กœ์˜ ํ™•์žฅ์„ ํ–ฅํ›„ ์—ฐ๊ตฌ ๋ฐฉํ–ฅ์œผ๋กœ ๋‚ด๋†“์•˜๋‹ค.

๊ทธ๋ฆฌ๊ณ  ์•„๋ž˜๋Š” ๋ฆฌ๋ทฐ ์ž‘์„ฑ์ž๊ฐ€ ์ƒ๊ฐํ•˜๋Š” limitation ์ด๋‹ค:

distillation๋œ Student model์ด 3D consistency distribution์„ ์œ ์ง€ํ•  ์ˆ˜ ์žˆ๋Š” ์ง€ ์ฆ๋ช…๋˜์ง€ ์•Š์•˜๋‹ค.