中文

动态世界中的多模态大语言模型感知、跟踪与推理

计算机视觉与模式识别 2026-03-16 v1

摘要

人类所居住的物理四维世界中,几何结构与语义内容随时间演化,构成动态的四维现实(包含时维的空间)。虽然当前多模态大语言模型(MLLM)在静态视觉理解方面表现出色,但它们是否也擅长进行“动态推理”,即感知、跟踪和推理演化场景中的时空动态?为系统评估其时空推理与局部动态感知能力,我们引入 Dyn-Bench,这是一个由多样化真实世界和合成视频数据集构建的大规模基准,支持稳健且可扩展的时空理解评估。通过从海量二维与四维数据源进行多级筛选,Dyn-Bench 提供了高质量的动态场景集合,包含 1000 份视频、7000 份视觉问答(VQA)对以及 3000 份动态对象定位对。我们探测了各种通用、空间和区域级别的 MLLM,观察其在语言与视觉层面的动态推理能力,发现现有模型常常在时空推理与动态对象定位之间难以同时保持强性能,往往对运动与交互产生不一致的解读。值得注意的是,常规的提示策略(如链式思考或基于标题的提示)提升有限,而结构化集成方法(包括基于掩码的融合和时空文本认知图(ST-TCM))显著提升了 MLLM 在物理四维世界中的动态感知与时空推理能力。代码与基准已发布于 https://dyn-bench.github.io/。

关键词

引用

@article{arxiv.2603.12746,
  title  = {Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World},
  author = {Yuzhi Huang and Kairun Wen and Rongxin Gao and Dongxuan Liu and Yibin Lou and Jie Wu and Jing Xu and Jian Zhang and Zheng Yang and Yunlong Lin and Chenxin Li and Panwang Pan and Junbin Lu and Jingyan Jiang and Xinghao Ding and Yue Huang and Zhi Wang},
  journal= {arXiv preprint arXiv:2603.12746},
  year   = {2026}
}