WorldExplorer:迈向生成完全可导航的3D场景
计算机视觉与模式识别
2025-09-17 v2
摘要
从文本生成3D世界是计算机视觉领域中备受期待的目标。现有工作受限于其在场景内部允许的探索程度,即在移出中心或全景视角时会产生拉伸和嘈杂的伪影。为此,我们提出 WorldExplorer,一种基于自回归视频轨迹生成的新方法,该方法可构建在广泛视角下保持一致视觉质量的完全可导航3D场景。我们通过创建对应于360度全景的多视图一致图像来初始化场景。然后,我们在迭代场景生成流水线中利用视频扩散模型对其进行扩展。具体而言,我们沿着预定义的短轨迹生成多个视频,以深度探索场景,包括围绕物体的运动。我们新颖的场景记忆以最相关的先前视图为每个视频提供条件,而碰撞检测机制则防止退化结果,如穿入物体。最后,我们通过 3D Gaussian Splatting 优化将所有生成的视图融合为统一的3D表示。与先前的方法相比,WorldExplorer 生成的高质量场景在大相机运动下保持稳定,首次实现了逼真且无限制的探索。我们相信这标志着向生成沉浸式且真正可探索的虚拟3D环境迈出了重要一步。
引用
@article{arxiv.2506.01799,
title = {WorldExplorer: Towards Generating Fully Navigable 3D Scenes},
author = {Manuel-Andreas Schneider and Lukas Höllein and Matthias Nießner},
journal= {arXiv preprint arXiv:2506.01799},
year = {2025}
}
备注
Accepted to SIGGRAPH Asia 2025. Project page: see https://mschneider456.github.io/world-explorer, video: see https://youtu.be/N6NJsNyiv6I, code: https://github.com/mschneider456/WorldExplorer