中文

MLLM-4D:面向视觉基准的时空智能

计算机视觉与模式识别 2026-03-03 v1

摘要

人类天生具备视觉基准的时空智能,这使我们能够从纯视觉输入中感知和推理关于 3D 空间随时间演化。尽管此能力至关重要,但在当前多模态大语言模型(MLLM)中仍是一个显著瓶颈。为解决这一挑战,我们提出 MLLM-4D 框架,旨在弥合训练数据 curated 和模型 post-training 在时空理解与推理方面的差距。在数据方面,我们开发了低成本的数据 curated 流程,将现有的立体视频数据集转化为高质量的时空指令数据。这导致了用于监督式微调(SFT)和强化式微调(RFT)的 MLLM4D-2M 和 MLLM4D-R1-30k 数据集,以及用于全面评估的 MLLM4D-Bench。在模型训练方面,我们的 post-training 策略通过 SFT 建立基础的时空理解能力,并通过采用专门的时空链式思考(ST-CoT)提示和时空奖励函数(ST-reward),运用 Group Relative Policy Optimization(GRPO)进一步催化时空推理能力,而无需修改模型架构。大量实验表明,MLLM-4D 在纯 2D RGB 输入下实现了时空理解与推理的时代性水平。项目页面:https://github.com/GVCLab/MLLM-4D。

关键词

引用

@article{arxiv.2603.00515,
  title  = {MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence},
  author = {Xingyilang Yin and Chengzhengxu Li and Jiahao Chang and Chi-Man Pun and Xiaodong Cun},
  journal= {arXiv preprint arXiv:2603.00515},
  year   = {2026}
}