模拟现实世界:多模态生成模型统一综述
计算机视觉与模式识别
2026-02-17 v3 人工智能
机器学习
摘要
理解与复制现实世界是人工通用智能(AGI)研究中的关键挑战。为此,许多现有方法如世界模型旨在捕捉支配物理世界的基本原理,从而实现更精确的模拟和有意义的交互。然而,这些方法常将不同模态(包括2D图像、视频、3D和4D表征)视为独立领域,忽略了它们之间的相互关联。此外,这些方法通常仅关注现实维度的单一维度,而未系统整合其连接性。本综述我们呈现一项针对多模态生成模型的统一综述,探讨数据维度在现实世界模拟中的演进。具体而言,本综述从2D生成(外观)开始,随后涉及视频(外观+动态)和3D生成(外观+几何),最终 culminate于4D生成,这一阶段整合了所有维度。据我们所知,这是首次尝试在单一框架内系统性地统一研究2D、视频、3D和4D生成。为指引未来研究,我们提供了关于数据集、评估指标和未来方向的全面综述,并为新手提供洞见。本综述作为多模态生成模型和现实世界模拟在统一框架内发展的桥梁。
引用
@article{arxiv.2503.04641,
title = {Simulating the Real World: A Unified Survey of Multimodal Generative Models},
author = {Yuqi Hu and Longguang Wang and Xian Liu and Ling-Hao Chen and Yuwei Guo and Yukai Shi and Ce Liu and Anyi Rao and Zeyu Wang and Hui Xiong},
journal= {arXiv preprint arXiv:2503.04641},
year = {2026}
}
备注
Repository for the related papers at https://github.com/ALEEEHU/World-Simulator