WorldCam:基于相机姿态的交互式自回归 3D 游戏世界
计算机视觉与模式识别
2026-03-18 v1
摘要
最近的视频扩散变换器进展使得能够允许用户在交互式游戏世界中探索生成环境的持续时间范围内的交互式游戏世界模型成为可能。然而,现有方法在精确动作控制和长期 3D 一致性方面存在挑战。大多数先前工作将用户动作作为抽象的条件信号,忽视了动作与 3D 世界之间根本的几何耦合——即动作诱导相对相机运动,累积为 3D 世界中的全局相机姿态。在本文中,我们将相机姿态 established 为统一的几何表示,以联合 grounding 即时动作控制和长期 3D 一致性。首先,我们定义基于物理的连续动作空间,并将用户输入表示为李代数,以派生精确的 6 自由度相机姿态,将其注入生成模型通过相机嵌入器以确保准确的动作对齐。其次,我们使用全局相机姿态作为空间索引检索相关过去观察,实现在长期导航期间几何一致的地点重访。为支持此项研究,我们引入了一个大规模数据集,包含 3000 分钟的真实人类游戏玩耍,标注有相机轨迹和文本描述。广泛的实验表明,我们的方法在动作可控性、长期视觉质量和 3D 空间一致性方面显著优于最先进的交互式游戏世界模型。
引用
@article{arxiv.2603.16871,
title = {WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation},
author = {Jisu Nam and Yicong Hong and Chun-Hao Paul Huang and Feng Liu and JoungBin Lee and Jiyoung Kim and Siyoon Jin and Yunsung Lee and Jaeyoon Jung and Suhwan Choi and Seungryong Kim and Yang Zhou},
journal= {arXiv preprint arXiv:2603.16871},
year = {2026}
}
备注
Project page is available at https://cvlab-kaist.github.io/WorldCam/