中文

视频推理:评估 MLLMs 提取、整合与重构时空证据的能力

计算机视觉与模式识别 2026-04-20 v2

摘要

具身智能体日益增长的兴趣推动了时空视频理解需求,而现有基准大多侧重于提取式推理,即答案可明确呈现于时空事件中。仍不清楚多模态大语言模型(MLLM)是否能够进行抽象式时空推理,这需要在时间上整合观察、组合分散线索,并推断隐含的空间和情境结构。为此,我们通过引入结构化评估分类体系,系统性地针对其核心维度构建可控的、情景驱动的合成 egocentric 视频数据集,以评估抽象式时空推理能力,涵盖物体、房间和楼层平面层级情景。基于此框架,我们提出 VAEX-BENCH,包含五个抽象推理任务及其提取式对照任务。我们的大规模实验比较了最新 MLLMs 在提取与抽象情境下的表现,揭示其在抽象任务上的局限性,并对底层瓶颈进行细粒度分析。该数据集将很快公开。

关键词

引用

@article{arxiv.2603.13091,
  title  = {Reasoning over Video: Evaluating How MLLMs Extract, Integrate, and Reconstruct Spatiotemporal Evidence},
  author = {Seunghwan Bang and Hwanjun Song},
  journal= {arXiv preprint arXiv:2603.13091},
  year   = {2026}
}

备注

Project page: https://disl-lab.github.io/VAEX-Bench/