Paper Information
Title: Lyra 2.0: Explorable Generative 3D Worlds
Authors: Sherwin Bahmani, Tianchang Shen, Jiawei Ren, Jiahui Huang, Yifeng Jiang, Haithem Turki, Andrea Tagliasacchi, David B. Lindell, Zan Gojcic, Sanja Fidler, Huan Ling, Jun Gao, Xuanchi Ren
Venue: SIGGRAPH Asia 2026
Link: [Paper], [Project], [Github]

Teaser Image

Introduction

Lyra 2.0은 single image와 사용자가 지정한 camera trajectory를 기반으로, 장시간 탐색 가능한 3D-consistent world를 생성하는 framework다. 기존 camera-conditioned video generation은 짧은 구간에서는 높은 품질과 좋은 카메라 제어를 보이지만, 긴 autoregressive generation에서는 두 가지 문제가 발생한다:

  1. 하나는 과거에 보았던 영역이 temporal context 밖으로 밀려난 뒤 다시 방문했을 때 구조를 제대로 기억하지 못하는 spatial forgetting.
  2. 다른 하나는 generation 과정의 작은 오류가 누적되면 색상이나 geometry가 점차 무너지는 temporal drfting이다.

기존 연구들은 이러한 문제를 해결하기 위해 camera pose나 Plücker ray, depth warping 같은 방식으로 카메라 정보를 주입하거나, 과거 frame retrieval, global 3D memory, latent/KV cache, FramePack 기반 history compression 등을 사용해 long-term consistency를 유지하려 했다. 하지만 global 3D representation을 직접 conditioning에 사용하는 방식은 부정확한 depth나 generation artifact가 누적되며 오히려 오류를 증폭시킬 수 있고, 단순히 history frame만 추가하는 방식은 큰 viewpoint 변화에서 정확한 geometric correspoindence를 찾기 어렵다는 한계가 있다.

Lyra 2.0은 이를 해결하기 위해 각 frame의 3D geometry를 하나의 global scene으로 fusion하지 않고 per-frame 3D memory로 유지하며, geometry는 appearance를 직접 생성하는 용도가 아니라 relevant history frame retrieval과 dense correspondence를 계산하는 information routing 용도로만 사용한다. 또한 모델 자신의 불완전한 generation을 history condition으로 사용하는 self-augmentation을 통해 temporal drifting에 대한 robustness Gaussian과 surface mesh로 변환되어, 기존 generative reconstruction 방식보다 더 넓고 지속적인 3D scene exploration을 가능하게 한다.

Method & Technical Details