中文

DynamicVerse: 一个面向四维世界建模的物理感知多模态框架

计算机视觉与模式识别 2025-12-04 v2

摘要

理解具有演化三维结构、真实世界运动和文本描述语义内容的动态物理世界,对于人机交互至关重要,并使具身智能体能够以类人能力感知和作用于真实环境。然而,现有数据集通常源自有限模拟器或利用传统运动恢复结构进行全尺度标注,且提供有限的描述性字幕,这限制了基础模型从单目视频(通常来自互联网)准确解读真实世界动态的能力。为弥补这些差距,我们引入了 DynamicVerse,一个面向动态真实世界视频的物理尺度、多模态四维世界建模框架。我们利用大型视觉、几何和多模态模型来解读度量级静态几何、真实世界动态运动、实例级掩码和整体描述性字幕。通过结合基于窗口的光束法平差与全局优化,我们的方法将长真实世界视频序列转换为全面的四维多模态格式。DynamicVerse 提供了大规模数据集,包含来自互联网视频的 10 万+视频、80 万+标注掩码和 1000 万+帧。在三个基准任务上的实验评估,即视频深度估计、相机位姿估计和相机内参估计,表明我们的四维建模在捕捉物理尺度测量方面优于现有方法,具有更高的全局精度。

关键词

引用

@article{arxiv.2512.03000,
  title  = {DynamicVerse: A Physically-Aware Multimodal Framework for 4D World Modeling},
  author = {Kairun Wen and Yuzhi Huang and Runyu Chen and Hui Zheng and Yunlong Lin and Panwang Pan and Chenxin Li and Wenyan Cong and Jian Zhang and Junbin Lu and Chenguo Lin and Dilin Wang and Zhicheng Yan and Hongyu Xu and Justin Theiss and Yue Huang and Xinghao Ding and Rakesh Ranjan and Zhiwen Fan},
  journal= {arXiv preprint arXiv:2512.03000},
  year   = {2025}
}