中文

OmniWorld: 面向4D世界建模的多领域多模态数据集

计算机视觉与模式识别 2025-09-25 v2

摘要

4D世界建模领域旨在联合捕捉空间几何与时间动态,在大规模生成模型与多模态学习的推动下,近年来取得了显著进展。然而,真正通用的4D世界模型的发展仍从根本上受限于高质量数据的可用性。现有数据集与基准通常缺乏支持4D几何重建、未来预测及相机控制视频生成等关键任务所需的动态复杂性、多领域多样性与时空标注。为弥补这一空白,我们引入了OmniWorld,一个专为4D世界建模设计的大规模、多领域、多模态数据集。OmniWorld由新收集的OmniWorld-Game数据集与多个跨越不同领域的精选公开数据集组成。与现有合成数据集相比,OmniWorld-Game提供了更丰富的模态覆盖、更大的规模以及更逼真的动态交互。基于该数据集,我们建立了一个具有挑战性的基准,揭示了当前最先进方法在建模复杂4D环境时的局限性。此外,在OmniWorld上对现有SOTA方法进行微调,在4D重建与视频生成任务中均取得了显著的性能提升,有力地验证了OmniWorld作为训练与评估强大资源的价值。我们期望OmniWorld能成为加速通用4D世界模型发展的催化剂,最终推进机器对物理世界的整体理解。

关键词

引用

@article{arxiv.2509.12201,
  title  = {OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling},
  author = {Yang Zhou and Yifan Wang and Jianjun Zhou and Wenzheng Chang and Haoyu Guo and Zizun Li and Kaijing Ma and Xinyue Li and Yating Wang and Haoyi Zhu and Mingyu Liu and Dingning Liu and Jiange Yang and Zhoujie Fu and Junyi Chen and Chunhua Shen and Jiangmiao Pang and Kaipeng Zhang and Tong He},
  journal= {arXiv preprint arXiv:2509.12201},
  year   = {2025}
}

备注

https://yangzhou24.github.io/OmniWorld/