中文

Lyra 2.0:可探索的生成式 3D 世界

计算机视觉与模式识别 2026-04-15 v1

摘要

近期的视频生成技术的进展正在催生一种新的 3D 场景创建范式:通过生成具有相机控制能力的视频,以模拟场景漫游,然后通过前馈重建技术将其提升至 3D。这种生成式重建方法将视频模型的视觉保真度和创造力与即插即用于实时渲染和仿真的 3D 输出相结合。大规模、复杂环境的扩展需求需要实现沿长相机轨迹的 3D 一致视频生成,这涉及大幅视角变化和位置回访,此类设置下当前视频模型会迅速退化。现有方法在长时程生成方面受限于两种形式的退化:空间遗忘和时间漂移。随着探索的进行,以前观察的区域会脱离模型的时序上下文,导致模型在回访时必须幻觉生成结构。而自回归生成会随时间累积细小的合成误差,逐渐扭曲场景的外观和几何形状。我们提出了 Lyra 2.0,一个用于大规模生成持久、可探索的 3D 世界的框架。为解决空间遗忘问题,我们维护每帧的 3D 几何信息,仅用于信息路由——检索相关过去帧并与目标视点建立稠密对应关系——同时依赖生成式先验进行外观合成。为解决时间漂移问题,我们采用自增强历史进行训练,使模型能够暴露于自身退化输出,从而学习校正漂移而非传递漂移。这些技术共同实现了 substantially 更长的 3D 一致视频轨迹,我们利用其对前馈重建模型进行微调,实现可靠的高质量 3D 场景恢复。

关键词

引用

@article{arxiv.2604.13036,
  title  = {Lyra 2.0: Explorable Generative 3D Worlds},
  author = {Tianchang Shen and Sherwin Bahmani and Kai He and Sangeetha Grama Srinivasan and Tianshi Cao and Jiawei Ren and Ruilong Li and Zian Wang and Nicholas Sharp and Zan Gojcic and Sanja Fidler and Jiahui Huang and Huan Ling and Jun Gao and Xuanchi Ren},
  journal= {arXiv preprint arXiv:2604.13036},
  year   = {2026}
}

备注

Project Page: https://research.nvidia.com/labs/sil/projects/lyra2/