[Paper Review, KR] SonoWorld: From One Image to a 3D Audio-Visual Scene
Paper Information
Title: SonoWorld: From One Image to a 3D Audio-Visual Scene
Authors: Derong Jin, Xiyi Chen, Ming C. Lin, Ruohan Gao
Venue: CVPR 2026
Link: [Paper], [Project], [GitHub]
Teaser Image
Introduction
๊ธฐ์กด์ ๋ชฐ์ ์ ์ธ 3D Scene์ ๋ง๋๋ ๋ฐฉ๋ฒ๋ก ๋ค ๊ทธ๋ฆฌ๊ณ ๊ธฐ๋ฒ๋ค์ ์ฌ์ค์ ์ธ 3D world๋ฅผ single image๋ก๋ถํฐ ๋ง๋ค ์ ์์ง๋ง, ์ด๋ ์ฒญ๊ฐ์ ์ธ ๊ฒฝํ์ ๊ฒฐ์ฌ๋์ด ์์ด ์ธ์ง์ ์ผ๋ก ๋ถ์์ ํ๋ค๊ณ ๋ ผ๋ฌธ์ ์ ์๋ค์ ์ฃผ์ฅํ๋ค.
๊ทธ๋์ ๋ ผ๋ฌธ์ ์ ์๋ค์ single image๋ก๋ถํฐ training free ๋ฐฉ์์ผ๋ก ์ผ๊ด์ ์ธ 3D Scene์ ๋ง๋๋ ๋์์ ๊ณต๊ฐ์ ์ธ sound field๋ฅผ ๋ง๋ค์ด user interaction๊น์ง ์ ๊ณตํ๋ ๊ฒ์ ๋ชฉํ๋ก ํ๋ค.
์ด๋ฅผ ์ํด์ 3๊ฐ์ง challenge๊ฐ ์กด์ฌํ๋ค:
- scene-level์ audio generation์ ์ ์์(point source), ์์ต ์์(areal source) ๊ทธ๋ฆฌ๊ณ ์ฃผ๋ณ ํ๊ฒฝ ์์ ๋ฑ ๋ค์ํ ํ์ ๊ณผ ์ค์ผ์ผ์ ์์์ผ๋ก ๊ตฌ์ฑ๋์ด์ผํ๋ค.
- ์์คํ ์ ๊ฐ์ฒด๊ฐ ๋ฌด์์ธ์ง, ์ด๋ป๊ฒ ๋ค๋ฆฌ๋์ง, ์ผ๋ง๋ ์๋๋ฌ์ธ์ง ๋ฑ์ ์ ์ถํ ์ ์๋๋ก ์ด์ ์ ์ด๊ณ ์๋ฏธ๋ก ์ ์ธ scene์ ๋ํ ์ดํด๊ฐ ํ์ํ๋ค.
- ์์ฑ๋ ๋ชจ๋ ์๋ฆฌ๋ ์ด๋ฏธ์ง๋ก๋ถํฐ ์ถ๋ก ๋ ํ๋นํ 3D ์์น์ ์์ด์ผ ํ๋ฉฐ, ์ธ์ง์ ์ผ๋ก ์ค์ ์ ๊ฐ์ ๊ณต๊ฐ์ ํจ๊ณผ๋ก ๋ ๋๋ง๋์ด์ผ ํ๋ค.
๊ด๋ จ๋ ์ฐ๊ตฌ ๋ถ์ผ๋ค์์๋ ์๋์ ๊ฐ์ ํ๊ณ์ ๋ค์ด ์กด์ฌํ๋ค(์ฐ๊ตฌ ๋ํฅ ํ์ธ์ด ์๋๋ผ๋ฉด ๊ฑด๋๋ฐ์ด๋ ๋ฉ๋๋ค.):
- ํด๋น ๋ ผ๋ฌธ์ ์ผ๊ด์ฑ ์๋ 360๋ ํ๋ ธ๋ผ๋ง๋ฅผ outpaintingํ๊ณ , depth alignment์ ๊ฐ์ฐ์์ ์ต์ ํ๋ฅผ ํตํด ์ด๋ฅผ 3D ๋ก liftingํ์ฌ Scene์ ์์ฑํ๋ ๊ธฐ์กด์ Panoramic method๋ฅผ ๋ฐ๋ผ๊ฐ์ง๋ง, ์๊ฐ ์ ๋ณด์ ํจ๊ป spatial audio๋ฅผ ๊ณต๋์ผ๋ก ๋ชจ๋ธ๋งํ๋ค๋ ์ ์์ ์ฐจ๋ณํ๋๋ค.
- ๊ธฐ์กด ๊ณต๊ฐ ์ํฅ ์์ฑ ๋ถ์ผ์์ ์งํ๋ ์ฐ๊ตฌ์ธ Sonic4D์ ๊ฒฝ์ฐ ๊ณต๊ฐ ์ํฅ ์์ฑ์ 4D Dynamic Scene๊ณผ ๊ฒฐํฉํ๋ ์์ค๊น์ง ๋์๊ฐ์ผ๋, ๋จ์ผ ๊ฐ์ฒด, ์ข์ ์์ผ๊ฐ, ๊ทธ๋ฆฌ๊ณ ์คํ๋ผ์ธ ์ฒ๋ฆฌ์๋ง ๊ตญํ๋์ด ์๋ํ๋ค๋ ํ๊ณ๊ฐ ์๋๋ฐ, SonoWorld๋ ์ด๋ฅผ ๋์ด ์ (point), ์์ญ(areal), ์ฃผ๋ณ(ambient) ์์๋ค๊ณผ ์ค์๊ฐ์ ์ธ exploration์ ์ง์ํ๋ค.
- Visual Scene์์ sound localization๊ณผ Audio-Visual Source Separation ๋ถ์ผ์์๋ ๊ฐ๊ฐ ๋จ์ํ ์๊ฐ์ ์ฅ๋ฉด ๋ด์์ ์๋ฆฌ๊ฐ ๋๋ ์์น๋ฅผ ์ถ์ ํ๋๊ฒ ์๋๋ผ VLM์ ํ์ฉํด์ ์์ฑ๋ 3D ํ๋ ธ๋ผ๋ง ์ฅ๋ฉด ์์ ์ ์ฌ์ ์ธ ์์๋ค์ ์ฐพ๊ณ ์ด๋ฅผ ๊ณต๊ฐ ์์ ์์น์ํค๊ฑฐ๋ ๋จ์ํ ํผํฉ ์ค๋์ค๋ฅผ ๊ฐ๋ณ component ์ค๋๋ก๋ก ๋ถ๋ฆฌํ๋๋ฐ ๊ทธ์น์ง ์๊ณ , ์์ฑ๋ 3D ์๊ฐ ์ฅ๋ฉด ๋ด์ ์์น๋ ๋ชจ๋ ์์์ ๋ํ์๋ก์ด ๊ณต๊ฐ ์ํฅ ์์ฑ์ ์ง์ ๊ตฌํํ๋ ๊ฒ์ผ๋ก ์ฐจ๋ณ์ ์ ๋ช ์ํ๋ค.
The Image2AVScene Task
Ambisonics Concept
1. Spatial Sound representation
Ambisonics๋ โ๋ด ์ฃผ๋ณ 360๋ ๊ณต๊ฐ์์ ์ด๋ ๋ฐฉํฅ์ผ๋ก ์ด๋ค ์๋ฆฌ๊ฐ ๋ค๋ฆฌ๋๊ฐโ๋ฅผ ๋ช ๊ฐ์ ์ค๋์ค ์ฑ๋๋ก ์์ถํด์ ํํํ๋ ๋ฐฉ๋ฒโ์ด๋ค.
SonoWorld๋ 3D Scene ์์ ๋์ธ sound source๋ค์ ์์น๋ฅผ ์ด์ฉํด ์ด Ambisonics ์ฑ๋๋ค์ ์ง์ ๊ณ์ฐํ๋ค.
์ฐจ๊ทผ ์ฐจ๊ทผ ์ดํดํด๋ณด์.
์ฐ๋ฆฌ๊ฐ ๋ฃ๋ ์ผ๋ฐ์ ์ธ mono audio(๊ณต๊ฐ ์ํฅ์ด ์๋)๋
\(a(t)\) ์ฒ๋ผ ์๊ฐ์ ๋ฐ๋ฅธ ์๋ฆฌ๋ง ํํํ๋ค.
๊ณต๊ฐ์ํฅ์์๋ ์๋ฆฌ๊ฐ ์ด๋ ๋ฐฉํฅ์์ ์ค๋์ง๋ ์์์ผ ํ๋ฏ๋ก:
\[a(\theta, \phi, t)\]๋ก ํํํ์ฌ \(\theta=azimuth, ์ข์ฐ๋ฐฉํฅ\), \(\phi=elevation, ์ํ ๋ฐฉํฅ\)๋ฅผ ํ๋ผ๋ฏธํฐ๋ก ์ฌ์ฉํ๋ค. ์ฆ, ๊ตฌ ๋ชจ์์ ์๊ฐํ๋ฉด ํธํ๊ฒ ์ดํดํ ์ ์๋ค:

2. Spherical Harmonics
๋ฌธ์ ๋ 360๋ ๋ชจ๋ ๋ฐฉํฅ์ ์๋ฆฌ๋ฅผ ๊ทธ๋๋ก ์ ์ฅํ๊ฒ ๋๋ฉด, ์ค์๊ฐ ์๋ฆฌ ๋ ๋๋ง๋ ํ๋ค ๋ฟ๋๋ฌ ์ ์ฅ์ฉ๋๋ ์ปค์ง๋ ๋ฌธ์ ๊ฐ ์๋ค. ๋์ , Ambisonics๋ ๋ช ๊ฐ์ ๊ธฐ๋ณธ์ ์ธ ๊ณต๊ฐ ํจํด์ ์ด์ฉํด์ ์ ์ฒด sound field๋ฅผ ํํํ๋ค.
์ ์ฌ๊ธฐ์ ๊ธฐ๋ณธ ๊ณต๊ฐ ํจํด์ ์ฐ๋ฆฌ๋ ์ด๋ ๊ฒ ํํํ๊ฒ ๋ค:
\[Y_l^m(\theta, \phi)\]์ด ์์ ์ฐ๋ฆฌ๊ฐ ํน์ ๋ฐฉํฅ์ ๋ํ \(\theta, \phi\) ๋ฅผ ๋ฃ์ด์คฌ์ ๋, ํด๋น ๋ฐฉํฅ์ ๋ํ ๊ฐ์ค์น๋ฅผ ์ฃผ๋ ํจ์๋ค. ์ฆ, ํด๋น ํ์๋ 360๋ ๊ฐ ๋ฐฉํฅ์ ๋ํด ์๋ก ๋ค๋ฅธ ๊ฐ์ค์น๋ฅผ ์ฃผ๋ ํจํด์ธ ๊ฒ์ด๋ค.
๋ฌผ๋ก , ์ด๋ฅผ ์ค๋ช ํ๊ธฐ ์ํด์๋ Fourier Transform์ด๋ผ๋ ๊ฑธ ์ค๋ช ํ๋๊ฒ ์ข๊ฒ ์ง๋ง, ๊ทธ๋ ๊ฒ ๋๋ฉด ๋๋ฌด ๊ธธ์ด์ง๊ธฐ ๋๋ฌธ์ ์ด๋ฅผ ๊ทธ๋ฅ โํน์ ํ 3D ๋ฐฉํฅ ํจํด์ ๋ํ๋ด๋ basisโ ๋ผ๊ณ ์๊ฐํด์ฃผ๋ฉด ์ข๋ค. basis๋ ๋จ์ํ ๊ธฐ๋ณธ ์ ํ๋์ํ์์ ๋์ค๋ ํํ์ด๋ ๋์ด๊ฐ๋๋ก ํ๊ฒ ๋ค.
๊ฐ๋จํ๊ฒ,
Fourier Transform์์ sin/cos ์ด basis ์ญํ ์ ํ๋ฏ, ๊ตฌ๋ฉด ๊ณต๊ฐ์์๋ spherical harmonics๊ฐ basis ์ญํ ์ ์ํํ๋ค.
3. Ambisonics coefficient
๋ ผ๋ฌธ์ Equation (1)์
\[a(\theta, \phi, t) \approx \sum_{l=0}^L \sum_{m=-l}^l Y_l^m (\theta, \phi)a_{l,m}(t) = y_L(\theta, \phi)^T \mathcal{a}_L(t)\]์ด๋ค.
์ฌ๊ธฐ์ \(Y_l^m (\theta, \phi)\) ๋ ๊ณต๊ฐ ๋ฐฉํฅ ํจํด์ด๊ณ , \(a_{l,m}(t)\)๋ ๊ทธ ํจํด์ ๋์ํ๋(Ambisonics๋ก ์ธ์ฝ๋ฉ๋) audio waveform์ด๋ค.
์ฆ, Ambisonics ์์๋ 360๋ sound field ์ ์ฒด๋ฅผ ์ง์ ์ ์ฅํ์ง ์๊ณ ,
\[a_{0,0}(t), a_{1,-1}(t), a_{1,0}(t), a_{1,1}(t) ...\]๊ฐ์ ์ฌ๋ฌ ๊ฐ์ audio channel๋ก ์ ์ฅํ๋ค.
์ด๊ฒ๋ค์ด ๋ ผ๋ฌธ์์ ๋งํ๋ Ambisonics coefficients, ์ฆ Ambisonics channel์ด๋ค.
๋จ์ํ๊ฒ, Equation (1)์ ์๋ฏธ๋
Directional Sound = Spatial Basis (Weights) ๊ฐ X Ambisonics Channels์ ๋ด๊ธด waveform
๋ผ๊ณ ์ดํดํ์.
4. Ambisonics order๊ณผ FOA
Ambisonics order ์ธ \(L\)์ ๊ณต๊ฐ ํํ ์ ๋ฐ๋๋ฅผ ๊ฒฐ์ ํ๋ค.
๋ ผ๋ฌธ์์ ์ฃผ๋ก ์ฌ์ฉํ๋ ๊ฒ์ \(L=1\)์ธ First-Order Ambisonics, FOA๋ค.
Ambisoncis channel ์๋ \((L+1)^2\) ๊ฐ ์ด๋ฏ๋ก FOA ์์๋ 4๊ฐ์ audio channel์ ์ฌ์ฉํ๋ค(Eq(1)์ ๋ณด๋ฉด ์๊ฒ ์ง๋ง, L=1์ด๋ฉด \(\sum\) ์ ์ํด ๋์ค๋ ๊ฒฐ๊ณผ๊ฐ์ ์ด 4๊ฐ๋ค).
์ฆ ์ด ๋ ผ๋ฌธ์์๋ \(a_1(t) \in \mathbb{R}^4\) ๋ผ๊ณ ์๊ฐํ๋ฉด ๋๋ค.
5. Point source๋ฅผ Ambisonics๋ก ๋ง๋ค๊ธฐ
์ด ๋ ผ๋ฌธ์์ ๊ฐ์ฅ ์ค์ํ ์์์ Equation (1)์ด ์๋ Equation (2)๋ค.
\[\mathcal{a}_L^{\text{single}} (t) = \sigma(d)a_{\text{src}}(t)y_L(u)\]- $a_{\text{src}}(t)$๋ ์๋ sound waveform.
- $u$๋ listener์์ source๋ฅผ ๋ฐ๋ผ๋ณด๋ ๋ฐฉํฅ.
- $\sigma(d)$๋ ๊ฑฐ๋ฆฌ์ ๋ฐ๋ฅธ sound attenuation.
๊ฐ๋จํ๊ฒ, ์๋์ ๊ฐ์ด ์ดํดํ๋ฉด ๋๋ค.
Ambisonics = ์๋ ์๋ฆฌ $\times$ ๋ฐฉํฅ์ ๋ณด $\times$ ๊ฑฐ๋ฆฌ ํจ๊ณผ
6. 3-DOF ์ 6-DOF
์ผ๋ฐ์ ์ธ Ambisoncis recording์ ํ ์์น์์ ์ธก์ ํ sound field ์ด๊ธฐ ๋๋ฌธ์
\[R \in SO(3)\]๋ก yaw, pitch, roll ์ ์ํํ๋ 3D rotation์ธ 3-DOF ๋ค.
ํ์ง๋ง listener๊ฐ ๋ค๋ฅธ ์์น๋ก ์ด๋ํ๋ฉด source ๊น์ง์ ๋ฐฉํฅ, ๊ฑฐ๋ฆฌ๊ฐ ๋ฌ๋ผ์ง๋ค.
Sonoworld๋ 3D ์์น๋ฅผ ์๊ณ ์๊ธฐ ๋๋ฌธ์, listener๊ฐ ์ด๋ํ๋ฉด ์๋ก์ด ์์น์์ u์ d๋ฅผ ๋ค์ ๊ณ์ฐํ์ฌ Equation (2)๋ฅผ ๋ค์ ์ ์ฉํ ์ ์๋ค.
๋ฐ๋ผ์,
3 rotation DoF + 3 translation DoF = 6-DoF
์ธ 6-DoF exploration์ด ๊ฐ๋ฅํด์ง๋ค.
7. ํท๊ฐ๋ฆด ์ ์๋ ๋ถ๋ถ
Equation (2)๋ ์ค์ ์๋ณธ source waveform์ธ mono audio์ source์ ๋ฐฉํฅ๊ณผ ๊ฑฐ๋ฆฌ ์ ๋ณด๋ฅผ ๋ฐ์ํ์ฌ ์ฌ๋ฌ ๊ฐ์ Ambisonics channel waveform์ผ๋ก ์ธ์ฝ๋ฉํ๋ ์์ด๋ค.
Equation (1)์ ๊ทธ๋ ๊ฒ ๋ง๋ค์ด์ง ์ฌ๋ฌ Ambisonics channel waveform์ ํน์ ๋ฐฉํฅ (ฮธ,ฯ)์ Spherical Harmonics ๊ฐ์ผ๋ก ๊ฐ์คํฉํ์ฌ, ๊ทธ ๋ฐฉํฅ์ ๋ฐ๋ผ๋ณด๋ virtual microphone์ directional waveform์ ์ป๋ ์์ด๋ค.
๋ฐฉํฅ $\mathbf{u}_{\mathrm{query}}$๋ฅผ ๋ฐ๋ผ๋ณด๋ virtual microphone์ waveform์
\[a_{\mathbf{u}_{\mathrm{query}}}(t) = \mathbf{y}_L(\mathbf{u}_{\mathrm{query}})^T \mathbf{a}_L(t)\]์ด๋ค.
Equation (2)๋ฅผ Equation (1)์ ๋์ ํ๋ฉด ์กฐ๊ธ ๋ ์ฝ๊ฒ ์ดํดํ ์ ์๋๋ฐ,
\[\mathbf{a}_L(t) = \sigma(d)\, a_{\mathrm{src}}(t)\, \mathbf{y}_L(\mathbf{u}_{\mathrm{src}})\]๋ฅผ Equation (1)์ ๋์ ํ๋ฉด,
\[a_{\mathbf{u}_{\mathrm{query}}}(t) = \mathbf{y}_L(\mathbf{u}_{\mathrm{query}})^T \left[ \sigma(d)\, a_{\mathrm{src}}(t)\, \mathbf{y}_L(\mathbf{u}_{\mathrm{src}}) \right]\]$\sigma(d)$์ $a_{\mathrm{src}}(t)$๋ scalar์ด๋ฏ๋ก ๋ฐ์ผ๋ก ๋นผ๋ฉด,
\[a_{\mathbf{u}_{\mathrm{query}}}(t) = \sigma(d)\, a_{\mathrm{src}}(t)\, \mathbf{y}_L(\mathbf{u}_{\mathrm{query}})^T \mathbf{y}_L(\mathbf{u}_{\mathrm{src}})\]๋ฐ๋ผ์
\[\boxed{ a_{\mathbf{u}_{\mathrm{query}}}(t) = \sigma(d)\, a_{\mathrm{src}}(t)\, \underbrace{ \mathbf{y}_L(\mathbf{u}_{\mathrm{query}})^T \mathbf{y}_L(\mathbf{u}_{\mathrm{src}}) }_{\text{directional matching term}} }\]์ฌ๊ธฐ์,
\[\mathbf{y}_L(\mathbf{u}_{\mathrm{query}})^T \mathbf{y}_L(\mathbf{u}_{\mathrm{src}})\]๊ฐ ํฌ๋ฉด, virtual microphone์ด ๋ฐ๋ผ๋ณด๋ ๋ฐฉํฅ๊ณผ ์ค์ source ๋ฐฉํฅ์ด Ambisonics basis ์ ์ ๋ง์ ์๋ฆฌ๊ฐ ํฌ๊ฒ ๋ค๋ฆฌ๋ ๋ฑ์ ์ํฅ์ด ์ผ์ด๋๋ค.
Task Goal
\[\mathcal{G}: I \rightarrow \{V(p), A(p,t)\}\]ํด๋น ์์์ ๋ณด๋ค์ํผ, ํน์ observer์ pose p๊ฐ ์ฃผ์ด์ก์ ๋, visual representation์ธ \(V(p)\)์ \(A(p,t)\)๋ฅผ ์ถ์ ํด framework์ธ \(\mathcal{G}\)๋ฅผ ๋ง๋ค์ด๋ด๋ ๊ฒ์ด๋ค.
์ด \(V(p)\) ๊ฐ์ ๊ฒฝ์ฐ๋ 3D guassian splats ๋ฅผ ์ด์ฉํด ํํํ๊ณ , \(A(p,t)\)์ ๊ฒฝ์ฐ์๋ point-cloud๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ํ๋ ambisonics rendering์ ํตํด์ ํํํ๋ค:
\[a_L(t) = A(p,t) \in \mathbb{R}^{(L+1)^2}\]Method & Technical Details
SonoWorld์ Key Technique์ ์ด 4๊ฐ๋ก ๋๋๋ค.
- ์ฒซ ๋ฒ์งธ๋ก, single image๋ฅผ ์ ๋ ฅ์ผ๋ก ๋ฐ์ 360๋ ํ๋ ธ๋ผ๋ง๋ฅผ ์์ฑํ๊ณ ์ด๋ฅผ 3D Scene์ Liftํ๋ ๊ฒ
- ๋ ๋ฒ์งธ๋ก, reconstructed๋ 3D ๊ณต๊ฐ์์ ์๋ฆฌ๊ฐ ์์ ๋ฒํ ์ค์ฒด๋ฅผ ์๋ณํ๊ณ ์์น๋ฅผ ๊ฒฐ์ ํ๋ ๊ฒ
- ์ธ ๋ฒ์งธ๋ก, spatial sound field๋ฅผ ์์ฑํ๋ ambisonics encoder๋ฅผ ์ค๊ณํ๋ ๊ฒ
- ๋ค ๋ฒ์งธ๋ก, ์ฒญ์ทจ์ ์ ์ฅ์์ ์ด๋ ์์น(pose)์์๋ ์ ์ฒด์ ์ธ binaural audio๋ฅผ ๋ ๋๋งํ๋ ๊ฒ
Panorama-Based Visual Scene Generation
๋จผ์ single image๋ฅผ ๋ฐ๊ฒ ๋๋ฉด, ๋ณดํต ๊ธฐ์กด์ ๊ธฐ๋ฒ๋ค์ ํด๋น ์ด๋ฏธ์ง๊ฐ ์ ๋ฉด์ ๋ฐ๋ผ๋ณด๊ณ ์ํ ์ํ์ ์๋ค๊ณ ๊ฐ์ ํ๋ค. ๊ทธ๋ฌ๋, ์ด ๊ฐ์ ์ single image๊ฐ ๊ธฐ์ธ์ด์ ธ ์๊ฑฐ๋ elevation์ด ๋ค๋ฅผ ๊ฒฝ์ฐ misalignment ๋ฌธ์ ๋ฅผ ์ผ๊ธฐํ ์ ์๋ค. ๊ทธ๋์, SonoWorld๋ ๋จผ์ single image๋ฅผ ๋ฐ์ ์ด๋ฅผ calibrationํ๋ ๊ฒ๋ถํฐ ์์ํ๋ค.
\[(\phi,f) = Calib(I) ,\]์ ๋ ฅ ์ด๋ฏธ์ง \(I\)๋ก GeoCalib๋ผ๋ ๋ชจ๋ธ์ ์ฌ์ฉํด์ gravity direction๊ณผ camera FOV๋ฅผ ์ถ์ ํ์ฌ \((\phi, f)\)์ธ camera elevation๊ณผ FoV๋ฅผ ์ถ์ ํ๋ค. ๋ค์์ผ๋ก perspective image \(I\)๋ฅผ equirectangular panorama์ reprojectionํ๊ธฐ์ํด \(\mathcal{W}_G\) Gaussian Pyramid๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ํ๋ warping operator๋ฅผ ์ฌ์ฉํ๋ค. ํด๋น operator๋ ๋ค์ค ์ค์ผ์ผ ์ํฐ์จ๋ฆฌ์ด์ฑ ์ํ๋ง์ ์ํํ๊ณ , ์ดํ์ warped image๋ WorldGen์ด๋ผ๊ณ ํ๋ outpainting model \(g_{outpaint}\)์ ์ฌ์ฉํด์ 360๋ ํ๋ ธ๋ผ๋ง๋ฅผ ์์ฑํ๋ค:
\[I_{pano} = g_{outpaint}(\mathcal{W}_G(I, \phi, f))\]๊ทธ๋ฆฌ๊ณ ๊ธฐ์กด์ panorama-to-3D reconstruction method๋ฅผ ์ฌ์ฉํ์ฌ ์์ฑ๋ ํ๋ ธ๋ผ๋ง๋ฅผ 3D Scene์ผ๋ก liftํ๋ค:
\[V = \mathcal{G}_v(I_{pano})\]์ฌ๊ธฐ์ ์ฌ์ฉํ๋ ๋ชจ๋ธ์ Marble model ์ด๋ HunyuanWorld 1.0์ ์ฌ์ฉํ์ฌ ์ฌ์ค์ ์ธ 3D ํ๊ฒฝ์ ๊ตฌ์ฑํ๋ค.
360ยฐ Audio-Visual Semantic Grounding
์ด๋ฒ์๋ 3D Scene ์์์ ์ด๋ค ๋ฌผ์ฒด๊ฐ ์๋ฆฌ๋ฅผ ๋ผ ์ ์๊ณ , ๊ทธ ๋ฌผ์ฒด๊ฐ ์ ํํ 3D ๊ณต๊ฐ์ ์ด๋์ ์๋์ง๋ฅผ ์ฐพ์๋ด๋ ๋จ๊ณ๋ค.
๋จผ์ , VLMํํ ์ ๋ ฅ ์ด๋ฏธ์ง \(I\)๋ฅผ ์ฃผ๊ณ , 4๊ฐ์ง์ ์ ๋ณด๋ฅผ ์ป์ด๋ธ๋ค.
- sound source ํ๋ณด category๋ค์ ์งํฉ \(C\)
- point/clustered/ambient sound type ๋ถ๋ฅ
- MMAudio๊ฐ waveform์ ์์ฑํ ๋ ์ฌ์ฉํ text prompt
- ๊ฐ sound source๊ฐ ์ผ๋ง๋ ํฌ๊ฒ ๋ค๋ ค์ผ ํ๋์ง๋ฅผ ๊ฒฐ์ ํ๋ Amplitude equalization parameter
๊ทธ๋ผ ์ด์ ์ฐ๋ฆฌ๋ category ์งํฉ \(C\)๋ฅผ ๊ฐ์ง๊ณ , ํด๋น sound category๋ค์ด panorama์ ์ด๋ ์์น์ ์๋ ์ง ์์์ผ ํ๋ค. ์ด๋ฅผ ์ํด์ open-vocabulary segmentation model์ธ X-Decoder๋ฅผ ์ฌ์ฉํ๋ค.
๊ทธ๋ฐ๋ฐ, X-Decoder ๋ ์ผ๋ฐ perspective image๋ฅผ ์ฌ์ฉํ๋๋ก ํ์ต๋์ด ์๊ธฐ ๋๋ฌธ์ ํ๋ ธ๋ผ๋ง ์ด๋ฏธ์ง์ธ \(I_{pano}\)๋ฅผ ์ฌ๋ฌ ๊ฐ์ ๊ฒน์น๋ perspective FoV image๋ก ์๋ผ์ ์ฌ์ฉํ๋ค. ์ด๋ ๊ฒ tile image๋ค์ category๋ฅผ ์กฐ๊ฑด์ผ๋ก ๊ฐ tile image์ ํด๋น๋๋ category segmentation mask๋ฅผ ๋ฝ๋๋ค:
\[M_{OVS, c}\]๊ทธ๋ฌ๋, X-Decoder๊ฐ ์ฌ๋ฌ tile๋ก ์๋ผ์ ์ฒ๋ฆฌํ๊ธฐ ๋๋ฌธ์ tile ๊ฒฝ๊ณ์์ mask๊ฐ ๋๊ธฐ๊ฑฐ๋, sky/ground์ฒ๋ผ ํฐ ์์ญ์ ๋ถ์ํ ์ ์๊ธฐ ๋๋ฌธ์ ํ๋ ธ๋ผ๋ง ์ด๋ฏธ์ง์์๋ ๋ฌผ์ฒด์ ์์ญ ์์ฒด๋ฅผ ๊น๋ํ๊ฒ ์ฐพ์๋ค๋ SAM2๋ฅผ ์ด์ฉํด์ mask๋ฅผ ํ ๋ฒ ๋ ๋ฝ๋๋ค. ๋ฌผ๋ก , X-Decoder๋ segmentation mask์ ๋ํด ์์ญ์ด ์ด๋ค ๋ฌผ์ฒด์ธ์ง semantic label์ ์ป์ ์ ์๊ณ , SAM2๋ ๊ทธ๋ด ์ ์๋ค๋ ์๋ก์ ์ฅ๋จ์ ์ ๋ณด์ํด์ฃผ๊ธฐ๋ ํ๋ค.
์ฆ, SAM2 ๋ class-agnostic sementation mask ์ธ
\[M_{pano}\]๋ฅผ ๋ฝ์๋ธ๋ค.
๊ทธ๋ฆฌ๊ณ X-Decoder์ ๊ฒฐ๊ณผ๋ฅผ SAM2 region์ confidence-weighted vote๋ฅผ ์งํํ๋ค.
overlapping๊ณผ semantic confidence๊ฐ ์ถฉ๋ถํ ํฌ๋ค๋ฉด ํด๋น SAM2 mask๋ฅผ ํน์ ์นดํ ๊ณ ๋ฆฌ์ mask๋ก ์ฑํํ๋ค. ๊ทธ๋ฌ๋ฉด ์ต์ข ์ ์ผ๋ก category \(c\)๋ง๋ค \(M_c\)๋ฅผ ์ป์ด ์ต์ข ์ ์ผ๋ก:
\[M=\cup_{c\in C}M_c\]๊ฐ ๋๋ค.
๊ทธ๋ฌ๋, ์์ง 2D ์์น์ผ ๋ฟ์ด๋ผ์ ์ด๋ฅผ 3D ๊ณต๊ฐ์ ์ฌ๋ ค๋์์ผ ํ๋ค. ๊ทธ๋์ ์ฐ๋ฆฌ๊ฐ ์ด์ ์ ๋ง๋ค์ด ๋์ 3D Scene \(V\)๊ฐ ์์ด ํด๋น scene์ผ๋ก ๋ถํฐ depth map \(D\)๋ฅผ ๋ ๋๋งํ๊ณ , ๊ฐ sound source mask \(M_i\)์ depth \(D\)๋ฅผ ์ด์ฉํด์
\[P_i = Lift(M_i, D)\]๋ฅผ ์ํํ๋ค. ๊ทธ๋ฌ๋ฉด ํ๋์ source๊ฐ
\[P_i = \{p_1, p_2, ... , p_N\}\]๊ฐ์ 3D point ์งํฉ์ผ๋ก ํํ๋๋ค.
๋ ผ๋ฌธ์ ๋ชจ๋ source์ \(P_i\)๋ฅผ ๋ชจ์ ๊ฒฐ๊ณผ๋ฅผ \(P\)๋ผ๊ณ ํ๊ณ , ์ด๊ฒ์ด scene ๋ด sounding object๋ค์ 3D ์์น๋ฅผ ๋ํ๋ธ๋ค๊ณ ์ค๋ช ํ๋ค.
๊ทธ๋ฐ๋ฐ ์ฌ๊ธฐ์์ SonoWorld github ์ฝ๋๋ฅผ ๋ณด๋ฉด, X-Decoder์ SAM2๋ฅผ ์ฌ์ฉํ๋๊ฒ ์๋ SAM3๋ฅผ ์ฌ์ฉํ๋ ๊ฑธ ๋ณผ ์ ์๋ค. ์๋ง๋ ์ด์ ์ X-Decoder์ SAM2๋ฅผ ์ฌ์ฉํ์ ๋๋ IOU ๋ฐฉ์์ผ๋ก ์ฒ๋ฆฌํด์ ๋ณด์๋ mask๋ฅผ ์ป์๊ฒ ์ง๋ง, SAM3๋ semantic label๊ณผ ์ ๊ตํ ์์ญ mask๋ฅผ ๋ชจ๋ ๋ฝ์ ์ ์๊ธฐ ๋๋ฌธ์ ์ด์ ๋ ๋ชจ๋ธ์ ๋๋ฆฌ๊ณ ์ถ๊ฐ ์๊ณ ๋ฆฌ์ฆ์ ์ฌ์ฉํด์ mask๋ฅผ ๊ฑธ๋ฌ๋ด๋ ์์ ์ ํ ํ์๊ฐ ์์ด์ง ๊ฒ ๊ฐ๋ค. ์ฆ, SAM3 ์์ฒด๊ฐ text concept์ผ๋ก instance๋ฅผ ์ฐพ๊ณ segmentationํ ์ ์๋ ๋ชจ๋ธ์ด๊ธฐ ๋๋ฌธ์ ๊ธฐ์กด ๋ฐฉ์์ธ SAM2 ์ X-Decoder๋ฅผ ๊ฐ์ด ์ฌ์ฉํ ํ์๊ฐ ์์ด์ง ๊ฒ์ด๋ค.
Ambisonics Encoding
์ด๋ฒ stage์์๋ ์ฅ๋ฉด์ ๋ค์ด๊ฐ ์๋ฆฌ๋ฅผ ์์ฑํ๊ณ ์ต์ข ์ ์ผ๋ก ๋ค๋ฆด 3D ์ ์ฒด ์ค๋์ค ์ ํธ๋ฅผ ์ํ์ ์ผ๋ก ์กฐ๋ฆฝํ๋ ๊ฒ์ด๋ค.
๋จผ์ ์ ์ VLM์ด ์ด๋ฏธ์ง ๋ถ์์ ํตํด ์ ์ํ ํ ์คํธ ํ๋กฌํฌํธ๋ฅผ ์ค๋์ค ์์ฑ AI์ธ MMAudio์ ์ฃผ์ ํ์ฌ, ๊ฐ object์ ์ด์ธ๋ฆฌ๋ ์๋ฆฌ(\(a_{i,raw}\))์ ์ ์ฒด ๋ฐฐ๊ฒฝ ์๋ฆฌ(\(a_{global}\))๋ฅผ ์์ฑํ๋ค. ์์ฑ๋ waveform์ volume์ ๊ทธ๋๋ก ์ฌ์ฉํ์ง ์๊ณ , VLM์ด ์์ธกํ sound energy (\(v_i\))๋ฅผ ๋ฐ์ ์์์ ํตํด ์ด ํ๋ผ๋ฏธํฐ ์์น๋งํผ ๋ฐ์๋ฒจ์ ์ค์ ๋ฌผ๋ฆฌ ์ ํธ ์ค์ผ์ผ๋ก ํ์ฐํ์ฌ ๊ณฑํด์ค๋ค:
\[a_i(t) = 10^{v_i/20}a_{i,raw}(t)\]์ด๋ ๊ฒ ๊ณฑํด์ฃผ๋ฉด ๊ฐ ์๋ฆฌ์ ๊ท ํ๊ฐ ์๋ ๋ณผ๋ฅจ ์กฐ์ ์ ๋ง์น๋ค.
๊ทธ๋ฆฌ๊ณ ์ด์ ์์์ ์ฐ๋ฆฌ๊ฐ global์ธ ์ ์ฒด ๋ฐฐ๊ฒฝ ์๋ฆฌ์ ๊ฐ object์ ์๋ฆฌ๋ฅผ ๋ถ๋ฆฌํ์๋๋ฐ, ์ฌ๊ธฐ์ global์ ๊ทธ๋๋ก ๋๊ณ grounding ๋ source๋ค์ \(\mathcal{O}\)๋ผ๊ณ ํ๊ณ , ์ด๋ฅผ \(\mathcal{O}_{point}\)์ \(\mathcal{O}_{cluster}\) ๋ก ๋๋๋ค.
๊ฐ๋ ์ ์ผ๋ก, point source๋ ๊ณต๊ฐ์ ์ผ๋ก ์์ source๋ก ํ๋์ ์์น๋ก ๋ํํด๋ ๊ด์ฐฎ์ ๊ฒฝ์ฐ๊ณ , clustered surce๋ ๊ณต๊ฐ์ ์ผ๋ก ๋๊ฒ ํผ์ ธ์์ด ํ ์ ์์ ์๋ฆฌ๊ฐ ๋๋ค๊ณ ํ๊ธฐ๋ณด๋ค, ์ ์ฒด์ ์ฌ๋ฌ ์์น์์ ์๋ฆฌ๊ฐ ๋๋ ๊ฒฝ์ฐ๋ก ๋ณด๋ฉด๋๋ค.
sound field๋ฅผ ์ ๊ณตํ๊ธฐ ์ํด์๋ listener pose ๋ ์ค์ํ๋ค. ๊ฒฐ๊ตญ user tracking์ด ๊ฐ๋ฅํด์ผ ์ฌ์ฉ์์๊ฒ ์ ์ฒด๊ฐ ์๋ ์ฌ์ด๋๋ฅผ ์ ๊ณตํ ์ ์๋ค. ๊ทธ๋ฌ๊ธฐ ์ํด์ listener๊ฐ ์ด๋์ ์๊ณ ์ด๋ ๋ฐฉํฅ์ ๋ฐ๋ผ๋ณด๋ ์ง(pose)๋ฅผ ์ด๋ ๊ฒ ํํํ๋ค:
\[p = [R, t] \in SE(3)\]์ฌ๊ธฐ์ t๋ listener์ 3D position, R์ listener์ rotation์ด๋ค. ์ด๋ก์จ ์ฒญ์์ ๊ณ ๊ฐ๋ฅผ ๋๋ ธ์ ๋, ๊ทธ๋ฆฌ๊ณ ์ด๋ํ์ ๋ ์ฌ์ด๋๊ฐ ์ด๋ป๊ฒ ๋ณํ ์ง ํํํ ์ ์๋ค. ์ฌ๊ธฐ์ ๋ํด source์ listener ์ฌ์ด์ ๊ฑฐ๋ฆฌ(\(d\))๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ๊ฐ์ ํจ๊ณผ๋ฅผ ๋ง๋ค์ด์ผ ํ๋ค. ๊ทธ ์์์ ์ด์ ๊ฐ์ด ํํํ ์ ์๋ค:
\[\sigma(d) = \frac{e^{-\alpha d}}{d}\]์ฌ๊ธฐ์ d๋ฅผ ๋ถ๋ชจ์ ๋ ์ผ๋ก์จ source๊ฐ ๋ฉ์ด์ง์๋ก ์๋ฆฌ๊ฐ ์์์ง๋ distance attenuation ํจ๊ณผ๋ฅผ ๋ด๊ณ , ๋ถ์์ ์๋ \(e^{-\alpha d}\)๋ฅผ ํตํด ๊ฑฐ๋ฆฌ๊ฐ ๋ฉ์ด์ง์๋ก ๊ณต๊ธฐ๋ฅผ ์ง๋๋ฉฐ ์๋ฆฌ๊ฐ ์ถ๊ฐ๋ก ๊ฐ์ ๋๋ air absorption์ ๋ชจ๋ธ๋งํ ์ ์๋ค.
์ฆ, ๋ฉ๋ฆฌ ์์์๋ก ์์๋ฅผ ์ค์ด๋ ํจ์๋ฅผ ๊ตฌํํ๋ค๊ณ ๋ณด๋ฉด ๋๋ค.
๊ทธ๋ผ ์ด์ ์ฐ๋ฆฌ๋ Ambisonics๋ฅผ ์ธ ์ข ๋ฅ์ soruce ๊ณต๊ฐ ์ํฅ์ผ๋ก ๊ตฌ์ฑ๋๋ค๋ ๊ฒ์ ์ ์ ์๋ค:
\[A = A_{point} + A_{cluster} + A_{global}\]๊ฐ source ๋ค์ Ambisonics๋ฅผ ๊ตฌํ๋ ๋ฐฉ๋ฒ์ ์๋๋ฅผ ์ด์ด์ ํ์ธํด๋ณด๊ธธ ๋ฐ๋๋ค.
Point source
์ฌ๊ธฐ์ point source๋ source \(i\)์ 3D point cluster \(P_i\)๋ฅผ ํ๋์ centroid \(o_i\)๋ก ํํํ๋ค.
๊ทธ๋ฌ๋ฉด ์๋ ์์น ๋ฒกํฐ๋
\[d_i = t - o_i\]์์์ ์ฐ๋ฆฌ๋ Ambisonics๋ก ๋ง๋๋ ์์์ ๋ค์๊ณผ ๊ฐ์ด ์ ์ํ๋ค.
\[a_L(t) = \sigma(d)a_{\mathrm{src}}(t)y_L(u)\]์ด ์์์ ๊ตฌ์กฐ๋ฅผ ๊ทธ๋๋ก ์ฌ์ฉํ์ฌ point source๋ฅผ Ambisonics๋ก ๋ง๋ค๋ฉด,
\[A_{\mathrm{point}} = \sum_{i \in \mathcal{O}_{\mathrm{point}}} a_{i,L} \sigma(\lVert d_i \rVert) y_L\left( R^T \frac{d_i}{\lVert d_i \rVert} \right)\]์ด๋ ๊ฒ ๋๋ค.
๊ทธ๋ฐ๋ฐ ์ฌ๊ธฐ์ \(u \rightarrow R^T \frac{d_i}{\lVert d_i \rVert}\)๋ก ๋์ด ์๋๋ฐ, ์ \(R^T\)๊ฐ ๋ค์ด๊ฐ๋์ง ์ดํด๋ณด์.
๊ทธ๋ฅ \(\frac{d_i}{\lVert d_i \rVert}\)๋ 3D world coordinate์์์ source ๋ฐฉํฅ์ด๋ค. ํ์ง๋ง ์ฐ๋ฆฌ๋ listener๊ฐ ํ์ฌ ๋ฐ๋ผ๋ณด๊ณ ์๋ ๋ฐฉํฅ์ ๊ธฐ์ค์ผ๋ก source๊ฐ ์ด๋์ ์๋์ง๋ฅผ ์ํ๊ธฐ ๋๋ฌธ์, listener rotation \(R\)์ ์ด์ฉํด ๋ฐฉํฅ์ listener ๊ธฐ์ค์ผ๋ก ๋ฐ๊ฟ์ฃผ์ด์ผ ํ๋ค.
\[y_L\left( R^T \frac{d_i}{\lVert d_i \rVert} \right)\]๋ฐ๋ผ์ ์ด ์์ ํ์ฌ listener ๊ธฐ์ค์ผ๋ก source \(i\)๊ฐ ์์นํ ๋ฐฉํฅ์ Spherical Harmonics ๊ฐ์ด๋ค.
์, ๊ทธ๋ฌ๋ฉด ๊ฐ๋ตํ๊ฒ ์ ๋ฆฌํด๋ณด์.
์ด ๋ณต์กํ ํ๊ธฐ๋ฅผ ์ง๊ด์ ์ผ๋ก ์ ์ผ๋ฉด,
\[\boxed{ \text{Point Ambisonics} = \sum_i \text{source waveform} \times \text{distance attenuation} \times \text{source direction SH} }\]๋ผ๊ณ ๋ณผ ์ ์๋ค.
์ฆ,
\[a_L(t) = \sigma(d)a_{\mathrm{src}}(t)y_L(u)\]ํด๋น ์์์ source๋ง๋ค ๊ณ์ฐํ ๋ค์ ๋ชจ๋ ๋ํ ๊ฒ์ด Point Source Ambisonics๋ค.
Clustered sources
๊ฐ์ด๋ ํญํฌ์ฒ๋ผ ๋๊ฒ ํผ์ณ์ง source๋ centroid ํ ์ ์ผ๋ก ํํํ๊ธฐ ์ด๋ ค์์ \(P_i\) ์์ ์๋ ๋ชจ๋ 3D point๋ฅผ ์ฌ์ฉํ๋ค:
\[A_{\mathrm{cluster}} = \sum_{i \in \mathcal{O}_{\mathrm{cluster}}} \frac{a_i}{\lvert P_i \rvert} \sum_{o \in P_i} \sigma\left(\lVert d \rVert\right) y_L\left( R^T \frac{d}{\lVert d \rVert} \right)\]์ฌ๊ธฐ์ point souce์ ๋ค๋ฅธ ์ ์ ๊ทธ์ source ํ๋์ ์ฌ๋ฌ 3D point๋ค์ด ์๋ค๋ ๊ฒ์ด๋ค. ์ฆ, ์๋์ clustered source ๋ด๋ถ์ ์๋ ๋ง์ ๊ฐ point source์ ๋ํด ์๋๋ฅผ ๊ณ์ฐํ๊ณ :
\[\sigma(\lVert d \rVert)y_L(\text{direction})\]์ ๋ถ ๋ํ ๋ค์, \(\frac{1}{\left \vert P_i \right \vert}\)๋ก ๋๋์ด ํ๊ท ์ ๋ธ๋ค.
์ฝ๊ฒ ๋งํ๋ฉด, \(\text{Clustered source} = \text{Average of point sources}\)์ด ๋๋ค.
๊ทธ๋ฐ๋ฐ, ๋ ผ๋ฌธ์ ์ ์๋ ํ๋์ insight๋ฅผ ๋ ์ ๊ณตํ๋ค.
์์ ์์์ฒ๋ผ clustered source๋ฅผ ์ฌ๋ฌ point source์ฒ๋ผ ์ฒ๋ฆฌํ๊ฒ ๋๋ฉด, ๊ฐ point๋ง๋ค ๋ฐฉํฅ์ด ๋ค๋ฅด๊ธฐ ๋๋ฌธ์ ๋ค๋ฅธ \(y_L\) ๊ฐ์ด ๋์ค๊ฒ ๋๋๋ฐ, ๊ทธ๋ ๊ฒ ๋๋ฉด Spherical Harmonics์ \(l>0\) ์ฑ๋ถ์ ๋ฐฉํฅ์ ๋ฐ๋ผ ์์/์์ ๊ฐ์ ๊ฐ์ง ์ ์๊ธฐ ๋๋ฌธ์, ์ฌ๋ฌ ๋ฐฉํฅ์ ๊ฐ์ ํฉ์น๋ฉด ์ผ๋ถ๊ฐ ์๋ก ์์ด์ง ์ ์๋ค.
๋ฐ๋ผ์, area sound๊ฐ listener๋ฅผ ๋๋ฌ์ธ๋ ๊ฒฝ์ฐ \(l>0\) ๋ฐฉํฅ ์ฑ๋ถ๋ค์ด ์๋ก ์์๋๋ ๊ฒฝํฅ์ด ์์ด, head rotation์ ๋ ๋ฏผ๊ฐํด์ง ์ ์๋ค.
Global ambience
์ด์ ๋ง์ง๋ง ๋ฐ๋, ์์ฃผ ๋จผ traffic ๋ฑ์ ํน์ 3D object์ ๋ถ์ด ์๋ ์๋ฆฌ๋ก ์ฒ๋ฆฌํ์ง ์๋๋ค.
์ฆ, global ambience์๋ ๋ฐฉํฅ์ ๋ณด๋ฅผ ๋ฃ์ง ์๊ฒ ๋ค๋ ์๋ฏธ๋ค.
\[A_{global} = a_{global} \begin{bmatrix} 1 \\ 0 \\ 0 \\ \vdots \\ 0 \end{bmatrix}\]๋ผ๋ ์์์ผ๋ก ํํ๋๋ค.
์ฒซ channel๋ง ์ฌ์ฉํ๋ ์ด์ ๋ ์ฒซ ๋ฒ์งธ๊ฐ \(l=0\)์ธ omnidirectional component ์ด๊ธฐ ๋๋ฌธ์ด๋ค.
Free-Viewpoint Rendering
์์๊ณผ์ ๋ค์ด ๋ชจ๋ ๋๋ฌ์ผ๋ฉด, ์ด์ ์ฐ๋ฆฌ๋ ๋ง๋ค์ด์ง visual scene๊ณผ ambisonics๋ฅผ ๊ธฐ๋ฐ์ผ๋ก visual๊ณผ binaural audio๋ฅผ ๋ ๋๋งํด์ฃผ์ด์ผ ์ฌ์ฉ์๊ฐ ๋ณด๊ณ ๋ค์ ์ ์๋ค.
binural audio๋ผ๋ ๊ฒ์ left ear์ right ear ํํ๋ก ํค๋ํฐ์ฉ ์ค๋์ค๋ฅผ ๋งํ๋ค.
์์ ๊ณผ์ ๋ค์ด ๋ชจ๋ ๋๋๋ฉด ์ฐ๋ฆฌ๋ listenter pose \(p\) ์์
\[a_L(t) = A(p,t)\]๋ผ๋ Ambisonics๊ฐ ๋ง๋ค์ด์ก๋ค.
FOA๋ผ๋ฉด L=1์ด๋ฏ๋ก 4๊ฐ์ waveform์ด ๋ง๋ค์ด์ก๋ค๊ณ ์๊ฐํ๋ฉด ๋๋ค:
\[a_1(t)= \begin{bmatrix} a_{0,0}(t) \\ a_{1,-1}(t) \\ a_{1,0}(t) \\ a_{1,1}(t) \end{bmatrix}\]์ด์ธ์ visual scene ๊ทธ๋ฅ 3DGS renderer๋ก pose \(p\) ์ ๋ํด \(V(p)\)๋ก ๊ทธ ์์น์์์ ์นด๋ฉ๋ผ ์ด๋ฏธ์ง๋ฅผ ์ ๊ณตํ๋ฉด ๋๋ค.
Ambisonics๋ฅผ ์ด๋ป๊ฒ left/right ear audio๋ก ์ ๊ณตํ ๊น? ๊ทธ๊ฑด HRTF๋ผ๋ ๊ธฐ๋ฒ์ด ๋ต์ด ๋ ์ ์๋ค.
HRTF๋ ํน์ ๋ฐฉํฅ์์ ์จ ์๋ฆฌ๊ฐ ์ฌ๋์ ๋จธ๋ฆฌ์ ๊ท๋ฅผ ๊ฑฐ์ณ ์ผ์ชฝ ๊ท์ ์ค๋ฅธ์ชฝ ๊ท์ ๊ฐ๊ฐ ์ด๋ป๊ฒ ๋๋ฌํ๋์ง๋ฅผ ๋ํ๋ด๋ ํํฐ๋ค.
๊ทธ๋ผ ์ด HRTF ๊ธฐ๋ฐ binaural rendering์ ํตํด์ ๋ ผ๋ฌธ์์๋ time-domain filter๋ฅผ
\[h_{l,m}^{left}, h_{l,m}^{right}\]๋ผ๊ณ ํํํ๋ค. ์ ํํ๋ ์ด๋ฅผ HRIR์ด๋ผ๊ณ ๋ถ๋ฅธ๋ค. ์์์ ๋ณด๋ฉด ์๊ฒ ์ง๋ง, Ambisonics์ ๊ฐ channel์ ๋ํด ํด๋น filter๋ฅผ convolution ํด์ค๋ค. ๊ทธ๋ผ ํด๋น Ambisonics channel์ด left/right ear์ ์ด๋ป๊ฒ ์ค์ ๋ก ๋ค๋ฆด์ง ๊ณ์ฐ๋๋ค.
์์์ผ๋ก ์์๋ฅผ ๋ณด๋ฉด,
\[h_{l,m}^{left} * a_{l,m} ,\; h_{l,m}^{right} * a_{l,m}\]๊ฐ ๊ณ์ฐ๋๋ค๊ณ ๋ณด๋ฉด ๋๋ค.
๊ทธ๋ฌ๋ฉด ์ต์ข ์์ ์๋์ ๊ฐ๋ค:
\[\begin{bmatrix} b_{\mathrm{left}} \\ b_{\mathrm{right}} \end{bmatrix} (t) = \sum_{\ell=0}^{L} \sum_{m=-\ell}^{\ell} \begin{bmatrix} h_{\ell,m}^{\mathrm{left}} * a_{\ell,m} \\ h_{\ell,m}^{\mathrm{right}} * a_{\ell,m} \end{bmatrix} (t)\]์ฆ, ์ผ์ชฝ ๊ท์ ๋ํ ๋ชจ๋ ambisonics channel๋ค๊ณผ filter์ convolution ๊ฐ๋ค์ ๋ํ๊ณ , ์ค๋ฅธ์ชฝ ๊ท๋ ๋๊ฐ์ด ํด์ค ๋ค์ ์ฌ์ฉ์์๊ฒ ์ ๊ณตํ๋ ๊ฒ์ด๋ค.
Experiments
3d ๊ณต๊ฐ์์ listener๊ฐ ํน์ ์์น์ ์์ ๋ ์ด๋ ๋ฐฉํฅ์์ ์ด๋ค ์๋ฆฌ๊ฐ ๋ค๋ ค์ผํ๋ ์ง๋ฅผ ํ๊ฐํ๋ ๋ฐ์ดํฐ์ ์ด๋ ๋ฒค์น๋งํฌ๊ฐ ์๊ธฐ ๋๋ฌธ์ ์ ๋ ํ๊ฐ๋ฅผ ์ํด ์ ์๋ค์ด ๋ง๋ SONOSCENE360์ ๋ฐ์ดํฐ์ ์ผ๋ก ์ฌ์ฉํ๋ค. ํด๋น ๋ฐ์ดํฐ์ ์๋ 360ยฐ ์์๊ณผ FOA audio๊ฐ ํจ๊ป ๋ค์ด ์๋ค. ์ ์ฑ ํ๊ฐ์ user study์์๋ ์ธํฐ๋ท์์ ๊ฐ์ ธ์จ ์ฌ์ง๊ณผ diffusion์ผ๋ก ์์ฑํ ์ด๋ฏธ์ง ๋ชจ๋ ์ถ๊ฐ๋ก ์ฌ์ฉํ๋ค.
๊ทธ๋ฐ๋ฐ, ๊ธฐ์กด์ baselines๋ก ์ผ์ SonoWorld์ ๊ฐ์ด IMAGE2AVSCENE task๋ฅผ ์ํํ๋ ๋ฐฉ๋ฒ์ด ์๋ค๋ ๊ฒ์ด ๋ฌธ์ ์ธ๋ฐ, ๊ทธ๋์ ์ ์๋ค์ ๋น์ทํ visual-conditioned spatial audio generation methods๋ฅผ baseline์ผ๋ก ๊ฐ์ ธ์์ SonoWorld setting์ ๋ง๊ฒ ์ ๋ ฅ์ ๋ณํํด์ค๋ค. ๊ทธ๋์ ๋น๊ตํ๋ ๋ฐฉ๋ฒ์ MMAudio, SEE-2-SOUND, ViSAGe, OmniAudio๋ค. ์ด ์ค์์ MMAudio๋ง monaural audio generator๊ณ , ๋๋จธ์ง๋ spatial audio generation ๋ฐฉ๋ฒ๋ค์ด๋ค.
๋น์ฐํ ์ค์ํ๊ฒ๋, Visual Scene์ SonoWorld ๊ฒ์ ์ ๊ณตํ๋ค. ๋ฌผ๋ก ๋ชจ๋ธ๋ค์ด ์ ๋ ฅ์ผ๋ก ์๊ตฌํ๋ ๊ฒ์ ๊ฐ๊ธฐ ๋ค๋ฅด๋, ๊ฐ์ visual scene์์ ๋ ๋๋ง๋ ๊ฑธ ํ ๋๋ก spatial audio๋ฅผ ์ผ๋ง๋ ์ ๋ง๋๋ ์ง ํ๊ฐํ๋ ๊ฒ์ด๋ค. ๊ฐ baselines์ input์ ์ด๋ป๊ฒ ์ฒ๋ฆฌํด์ ์ฃผ์๋ ์ง๋ ๋ ผ๋ฌธ์ ํ์ธํด๋ณด๊ธธ ๋ฐ๋๋ค.
Quantitative Results
๋จผ์ SonoWorld๋ ๋ ๊ฐ์ง ํ์ ์ ํ์ดํ๋ผ์ธ์ ์ค๋นํ๋ค:
- Open-Source version: 3D reconstruction model์ HunyuanWorld-1.0๊ณผ sound-source proposal ๋ชจ๋ธ (VLM)์ LLaVA-Next-34B ๋ก ์ฌ์ฉํ๋ ๋ฒ์
- Proprietary version: 3D reconstruction model์ Marble๊ณผ sound-source propoasal ๋ชจ๋ธ (VLM)์ GPT-5๋ก ์ฌ์ฉํ๋ ๋ฒ์
ํด๋น Table์ ๋ ์ข ๋ฅ์ metric์ ๋ณธ๋ค: Spatial Metrics, Semantic Metric
์ฆ, ์๋ฆฌ๊ฐ ์ฌ๋ฐ๋ฅธ 3D ๋ฐฉํฅ์์ ๋ค๋ฆฌ๋ ์ง, ๊ทธ๋ฆฌ๊ณ ๊ทธ ๋ฐฉํฅ์์ ์ค์ ๋ก ์ ์ ํ ์ข ๋ฅ์ ์๋ฆฌ๊ฐ ๋ค๋ฆฌ๋ ์ง ํ๊ฐํ๋ ๊ฒ์ด๋ค.
$\triangle_{abs \theta}$๋ zimuth ์ค์ฐจ๋ฅผ ๋งํ๊ณ , $\triangle_{abs \phi}$๋ elevation ์ค์ฐจ๋ฅผ ๋งํ๊ณ , $\triangle_{Angular}$๋ ์ ์ฒด์ ์ธ 3D ๊ฐ๋ ์ค์ฐจ๋ฅผ ๋งํ๋ค. ๊ทธ๋ฆฌ๊ณ CC์ AUC๋ ์ฌ๋ฌ source๊ฐ ์์ ๋ ๊ตฌ๋ฉด ์ ์ฒด์ sound energy distribution์ด GT์ ์ผ๋ง๋ ๋น์ทํ๊ฐ๋ฅผ ๋ณด๋ metric์ด๋ค.
ํ๋ฅผ ๋ณด๋ฉด ์๊ฒ ์ง๋ง, ์ ๋ฐ์ ์ผ๋ก Open-source ๋ชจ๋ธ๋ก ํด๋น ๋ฐฉ๋ฒ๋ก ์ผ๋ก ์งํํด๋ ๊ธฐ์กด ๋ฐฉ๋ฒ๋ค๋ณด๋ค ์ข์ ์ฑ๋ฅ์ ๋ณด์ด๋ ๊ฑธ ๋ณผ ์ ์๋ค. ๋ํ Proprietary model๋ค๋ก ๋ฐ๊ฟจ์ ๋๋ ๋์ฑ ์ข์ ์ฑ๋ฅ์ ๋ณด์ฌ์ค๋ค.
๊ทธ๋ฆฌ๊ณ ์ ์๋ค์ ๋ณธ์ธ๋ค์ด ์ ํ scene๋ค์ด sonoworld์๋ง ์ ๋ฆฌํ๊ฒ ์์ฉํ์ง ์์์์ ๋ณด์ฌ์ฃผ๊ธฐ ์ํด์ SONOSCENE360์ ๊ฐ scene์ ๋ํด ๋ฐ๋ก metric ๊ฒฐ๊ณผ๋ฅผ ๋ณด์ฌ์ค๋ค. ํด๋น figure๋ฅผ ๋ณด๋ฉด ์๊ฒ ์ง๋ง, ๋ชจ๋ scene์์ baseline๋ณด๋ค ์ผ๊ด๋๊ฒ ๋์ ์ฑ๋ฅ์ ๋ณด์๋ค๊ณ ์ค๋ช ํ๋ค.
์ ์๋ค์ User study๋ ์งํํ๋ค. ์ฐธ๊ฐ์๋ 50๋ช , scene์ ์ด 12๊ฐ๋ค. ๊ทธ๋ฆฌ๊ณ ์ธ ๊ฐ์ง pair-wise comparison์ ์ํํ๋ค:
- ours vs. MMAudio
- ours vs. OmniAudio
- OmniAudio vs. MMAudio
๊ฐ scene์์ visual video๋ ๋ชจ๋ ๋ฐฉ๋ฒ์ด ์์ ํ ๋์ผํ๊ณ , audio๋ง ๋ค๋ฅด๊ฒ ์์ฑํ๋ค.
์ฐธ๊ฐ์๋ spatial coherence, audio-visual semantic alignmnet๋ฅผ ๊ธฐ์ค์ผ๋ก ์ด๋ audio๊ฐ ๋ ์ข์์ง ์ ํํ๋ค. ๊ทธ๋ฆฌ๊ณ real scene๊ณผ synthetic scene ๋ชจ๋์์ SonoWorld์ human preference๊ฐ ๊ฐ์ฅ ๋๊ฒ ๋ํ๋ฌ๋ค.
Qualitative Results
๋ ผ๋ฌธ์์๋ ๋จผ์ SonoWorld๋ก ๋ง๋ 3D audio-visual scene์ ์ค์ ๋ก ์์ ๋กญ๊ฒ ๋์๋ค๋๋ฉด์ ์ค์๊ฐ์ผ๋ก ๋ณผ ์ ์๋ ์ง ํ์ธํ๋ค.
๋ ผ๋ฌธ์์๋ ์ด๋ ๊ฒ ๋งํ๋ค:
โFountain scene์์ Apple M3 Pro ๊ธฐ์ค audio callback์ด 1 ms ๋ฏธ๋ง์ด๊ณ , 48 kHz์์ 256-sample buffer ํ๋๊ฐ ์ฌ์๋๋ ์๊ฐ์ด ์ฝ 5.3 ms์ด๋ค.โ
audio ์ค์ ์ 48 kHz ๋ผ๊ณ ์ธ๊ธํ๋ค. ์ด ์๋ฏธ๋ 1์ด์ audio waveform์ 48000๊ฐ์ ์ซ์๋ก ํํํ๋ค๋ ๋ป์ด๋ฉฐ, sample ํ๋๊ฐ ๋ด๋นํ๋ ์๊ฐ์ \(\frac{1}{48000} sec\)์ด๋ค. ์ฝ 0.0208ms ์ ๋๋ค. audio system์ sample ํ๋๊ฐ ๋๋๋ฉด ๋งค๋ฒ CPU๋ฅผ ํธ์ถํด์ ๋ค์ sample์ ์ฒ๋ฆฌํ๋ ๋ฐฉ์์ด ๋นํจ์จ์ ์ด์ด์ ์ฌ๋ฌ sample์ buffer๋ผ๋ ๋ฌถ์์ผ๋ก ์ฒ๋ฆฌํ๋๋ฐ, SonoWorld์ ๊ฒฝ์ฐ ๋ ผ๋ฌธ์์ ์ธ๊ธํ๋ buffer size๊ฐ 256 samples ์ธ ๊ฒ์ด๋ค.
์ฌ๊ธฐ์ audio callback์ ํ์ฌ 256 sample์ ์ฌ์์ด ๋๋๊ณ listener์ ์์น๊ฐ ๋ณ๊ฒฝ๋๋ฉด, ๋ค์ 256 samples์ ๋ํด ์๋์ ๊ณ์ฐ ๊ณผ์ ์ ์ค๋์ค ์ฌ์์๊ฐ 5.3ms ์ด๋ด์ ๋๋ด๋์ผ listener๊ฐ ๊ณ์ ์ค์๊ฐ์ผ๋ก ๋ค์ ์ ์๋ค:
\[\boxed{ \begin{gathered} \text{Audio system:} \\ \text{"๋ค์ 256 samples ํ์."} \\ \downarrow \\ \text{SonoWorld audio callback} \\ \downarrow \\ \text{ํ์ฌ listener pose ํ์ธ} \\ \downarrow \\ \text{sound source์ ๊ฑฐ๋ฆฌ/๋ฐฉํฅ ๊ณ์ฐ} \\ \downarrow \\ \text{Ambisonics ๊ณ์ฐ} \\ \downarrow \\ \text{HRTF decoding} \\ \downarrow \\ \text{Left/Right 256 samples ์์ฑ} \end{gathered} }\]์ด๋ ๊ฒ ๋๊น์์ด ์ค์๊ฐ์ผ๋ก listener๊ฐ ๊ณต๊ฐ ์ํฅ์ ๋ฃ๋ ๊ฒ์ด ๊ฐ๋ฅํ๋ค.
ํด๋น figure๋ 360ยฐ ๊ณต๊ฐ์์ ์ด๋ ๋ฐฉํฅ์ sound energy๊ฐ ๊ฐํ๊ฒ ์กด์ฌํ๋ ์ง ๋ณด์ฌ์ค๋ค. ์ด๋ฅผ ํตํด spatial audio์ ๋ฐฉํฅ ๋ถํฌ๊ฐ ์ค์ FOA์๋ ์๊ฐ์ ์ผ๋ก ๋น์ทํ๋ค๋ ๊ฒ์ ๋ณผ ์ ์๋ค.
Contribution
- ๊ณต๊ฐ ์ํฅ ํ๋์ ์ํธ์์ฉ์ด ๊ฐ๋ฅํ 3D ์๊ฐ ์ฅ๋ฉด์ ๊ณต๋ ์์ฑํ๋ ์๋ก์ด ๋์ ๊ณผ์ ์ธ โIMAGE2AVSCENEโ์ ์ ์ํ๊ณ ์ต์ด์ ํจ๊ณผ์ ์ธ ํ๋ ์์ํฌ์ธ SONOWORLD๋ฅผ ๊ตฌ์ถ
- ํ๊ฐ ๋ฐ์ดํฐ์ ์ธ SONOSCENE360์ ์ง์ ์์งํ๊ณ ๊ธฐ์ฌํ์๋ค.
- ์ ๋ ํ๊ฐ ์งํ์ ์ ์ฑ ํ๊ฐ ๊ทธ๋ฆฌ๊ณ ์ฃผ๊ด์ ์ธ์ง ํ๊ฐ๋ฅผ ํตํ์ด ๊ธฐ์กด์ ์ฐ์ํ ๋ฒ ์ด์ค๋ผ์ธ ๋ชจ๋ธ๋ค์ ํฐ ์ฐจ์ด๋ก ์์ฐ์ผ๋ฉฐ, ์ฌ๋ฌ applications์์ ์ฌ์ฉ ๊ฐ๋ฅ์ฑ์ ๋ณด์ฌ์ฃผ์๋ค.
Limitations & Future work
์์ฝ๊ฒ๋ ์ด ๋ ผ๋ฌธ์ staticํ 3D visual scene์ ๊ธฐ์ค์ผ๋ก ์งํ๋์๋ค. ์ฆ, object๋ค์ด ์์ง์ด๋ 4D Scene์๋ ์ ์ฉ๋์ง ์์ ๊ฒ์ด๋ค. ๊ฐ๋จํ๊ฒ, ํด๋น ๋ ผ๋ฌธ์ user tracking์ ํตํ ๊ณต๊ฐ ์ํฅ ์ฒ๋ฆฌ์ ์ง์คํ๋ค๊ณ ๋ณผ ์ ์๋ค. ์ดํ์ ์ฐ๊ตฌ๋ฅผ ํตํด 4D Scene์ ์ ์ฉํ ๋๋ user tracking ๋ฟ๋ง ์๋๋ผ object tracking์ ๋์์ ์ํํ์ฌ ์์ง์ด๋ ์์์ด ๊ณต๊ฐ ์ํฅ์ ์ํฅ์ ์ฃผ๋ ๊ฒ๊น์ง ๋ ๋๋ง๋ ์ ์๋๋ก ํ ์ ์์ ๊ฒ์ด๋ค.