中文

CrossVid:评估多模态大语言模型跨视频推理的综合基准

计算机视觉与模式识别 2025-12-02 v2 人工智能

摘要

跨视频推理(CVR)是视频理解中的一个重大挑战,需要同时理解多个视频以聚合和比较视频组之间的信息。大多数现有视频理解基准仅关注单视频分析,无法评估多模态大语言模型(MLLMs)在多个视频上的联合推理能力。最近的基准评估 MLLMs 在多视角视频(捕获同一场景不同视角)上的能力,但其任务有限,难以全面评估 MLLMs 在 diverse 实际场景下的 CVR 能力。为此,我们引入CrossVid,第一个专为全面评估 MLLMs 在跨视频语境下空间-时间推理能力而设计的基准。首先,CrossVid 包含广泛的分层任务,涵盖四个高层维度和十个具体任务,紧密反映真实视频理解的复杂性和多样性。其次,CrossVid 提供 5,331 个视频,以及 9,015 对具有挑战性的问答对,涵盖单选、多选和开放式问答格式。通过在各种开源和闭源 MLLMs 上进行大量实验,我们观察到 Gemini-2.5-Pro 在 CrossVid 上表现最佳,平均准确率达 50.4%。值得注意的是,我们的深入案例研究表明,大多数当前 MLLMs 在 CVR 任务上表现不佳,主要原因是无法整合或比较跨多个视频分布的证据以进行推理。这些发现凸显了 CrossVid 在指导未来提升 MLLMs CVR 能力方面的潜力。

关键词

引用

@article{arxiv.2511.12263,
  title  = {CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models},
  author = {Jingyao Li and Jingyun Wang and Molin Tan and Haochen Wang and Cilin Yan and Likun Shi and Jiayin Cai and Xiaolong Jiang and Yao Hu},
  journal= {arXiv preprint arXiv:2511.12263},
  year   = {2025}
}

备注

Accepted to AAAI 2026 (main track). For code and data, see https://github.com/chuntianli666/CrossVid