DSG-World:基于双状态视频学习3D 高斯世界模型
计算机视觉与模式识别
2025-06-06 v1
摘要
从有限观察构建高效且物理一致的世界模型是视觉和机器人学中长期存在的挑战。许多现有的世界建模管道基于隐式生成模型,这些模型难以训练,往往缺乏3D 或物理一致性。另一方面,基于单个状态的显式3D 方法通常需要多阶段处理——例如分割、背景完成和填充——due to 遮挡问题。为此,我们利用同一场景下不同物体配置下的两个扰动观察。这些双状态提供了互补的可见性,在状态转换期间缓解遮挡问题,使重建更稳定和完整。在本文中,我们提出了DSG-World,一个从双状态观察显式构建3D 高斯世界模型的新型端到端框架。我们的方法构建双分割感知的高斯场,并强制双向光学和语义一致性。我们进一步引入伪中间状态用于对称对齐,设计协作共剪枝策略以细化几何完整性。DSG-World能够在显式高斯表示空间中实现高保真渲染和对象级场景操控,无需依赖稠密观察或多阶段管道。广泛的实验表明,该方法对新视角和场景状态具有强大的泛化能力,凸显了其在实际世界3D 重建和仿真中的有效性。
引用
@article{arxiv.2506.05217,
title = {DSG-World: Learning a 3D Gaussian World Model from Dual State Videos},
author = {Wenhao Hu and Xuexiang Wen and Xi Li and Gaoang Wang},
journal= {arXiv preprint arXiv:2506.05217},
year = {2025}
}