FantasyWorld:通过统一视频与 3D 预测实现几何一致的世界建模
计算机视觉与模式识别
2025-11-03 v2
摘要
高质量的 3D 世界模型对具身智能和通用人工智能(AGI)至关重要,支撑着 AR/VR 内容创作和机器人导航等应用。尽管已确立了强大的想象先验,但当前的视频基础模型缺乏显式的 3D 基础能力,因此在空间一致性及其对下游 3D 推理任务的实用性方面受到限制。在本工作中,我们提出了 FantasyWorld,这是一个几何增强框架,通过可训练的几何分支增强冻结的视频基础模型,从而在单次前向传播中实现视频潜变量与隐式 3D 场的联合建模。我们的方法引入了跨分支监督,其中几何线索引导视频生成,视频先验正则化 3D 预测,从而产生一致且可泛化的 3D 感知视频表示。值得注意的是,来自几何分支的所得潜变量可作为下游 3D 任务(如新视角合成和导航)的通用表示,而无需逐场景优化或微调。大量实验表明,FantasyWorld 有效地桥接了视频想象与 3D 感知,在多视角一致性和风格一致性方面优于最近的几何一致基线。消融研究进一步证实,这些增益源于统一的主干和跨分支信息交换。
引用
@article{arxiv.2509.21657,
title = {FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction},
author = {Yixiang Dai and Fan Jiang and Chiyu Wang and Mu Xu and Yonggang Qi},
journal= {arXiv preprint arXiv:2509.21657},
year = {2025}
}