中文

MMR-V:未言明之处?视频多模态深度推理基准

计算机视觉与模式识别 2025-06-05 v1 计算与语言

摘要

视频的序列结构对多模态大语言模型(MLLM)定位多帧证据并进行多模态推理的能力构成了挑战。然而,现有的视频基准主要关注理解任务,这些任务仅要求模型匹配问题中提到的帧(以下简称“问题帧”)并感知少数相邻帧。为了解决这一差距,我们提出了MMR-V:视频多模态深度推理基准。该基准具有以下特点:(1)长程、多帧推理:要求模型推断和分析可能远离问题帧的证据帧。(2)超越感知:问题不能仅通过直接感知来回答,而需要对隐藏信息进行推理。(3)可靠性:所有任务均经过人工标注,参考了大量真实世界的用户理解,以符合普遍认知。(4)混淆性:精心设计的干扰项标注策略,以减少模型走捷径。MMR-V包含317个视频和1,257个任务。我们的实验表明,当前模型在多模态推理方面仍然困难重重;即使性能最好的模型o4-mini也仅达到52.5%的准确率。此外,当前的推理增强策略(思维链和扩展测试时计算)带来的收益有限。进一步分析表明,多模态推理所需的CoT与文本推理中的CoT不同,这在一定程度上解释了性能提升有限的原因。我们希望MMR-V能够激发更多关于增强多模态推理能力的研究。

关键词

引用

@article{arxiv.2506.04141,
  title  = {MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos},
  author = {Kejian Zhu and Zhuoran Jin and Hongbang Yuan and Jiachun Li and Shangqing Tu and Pengfei Cao and Yubo Chen and Kang Liu and Jun Zhao},
  journal= {arXiv preprint arXiv:2506.04141},
  year   = {2025}
}

备注

Project Page: https://mmr-v.github.io