MovieRecapsQA:面向多模态开放式视频问答的基准
计算机视觉与模式识别
2026-04-01 v2
摘要
理解现实世界视频(如电影)需要整合视觉线索和对话线索。然而,现有的视频问答基准测试难以捕捉这种多模态推理,且鉴于自由形式答案的评估困难,主要依赖简单多选题。我们引入了一个新型的开放式多模态视频问答基准——MovieRecapsQA,基于电影回顾视频构建。电影回顾视频是一种独特的YouTube内容类型,通过旁白描述电影中的关键片段来总结电影。从60个回顾视频的旁白文字(回顾摘要)中,我们生成约8200个问题,并为每个问题准备必要的“事实”,前者促进需要多模态推理的问题创建,后者则允许构建可用于开放式响应的无参考评估指标。据我们了解,这是第一个无参考的开放式视频问答基准。该基准允许在不同的输入视频设置下评估每个问题:给定(a)完整电影,(b)完整(约11分钟)回顾视频(视觉仅),(c)约14分钟的对齐电影场景(与问题相关),以及(d)约1.2分钟的对齐回顾视频场景。在所有情况下,都提供任何关联电影对话的文本。每个问题按所需模态(视觉、对话或两者)进行分类,从而实现对多模态能力的细粒度评估。我们对比了七个最先进的多模态大语言模型(MLLMs),发现:(i)只有我们的无参考指标才能产生有意义的人类对齐模型分离;(ii)视觉中心问题在所有模型中得分最低;(iii)移除视觉输入时,模型的事实性反而会提高;(iv)主要瓶颈是视觉感知,而非视觉推理。
引用
@article{arxiv.2601.02536,
title = {MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark},
author = {Shaden Shaar and Bradon Thymes and Sirawut Chaixanien and Claire Cardie and Bharath Hariharan},
journal= {arXiv preprint arXiv:2601.02536},
year = {2026}
}
备注
CVPR 2026