VRR-QA:超越显式线索的视频视觉关系推理
计算机视觉与模式识别
2026-03-31 v3
摘要
视频问答(VideoQA)通过多模态学习对齐视觉与文本模态,取得了显著进展。然而,当前基准测试几乎全部聚焦于可通过显式视觉内容(即帧内或短片段中可直接观察到的动作、物体和事件)回答的问题。在人类水平上理解视频的过程中,模型必须超越直接呈现的内容,推断仅在帧之间隐含的隐藏关系和情境线索。当前基准测试未能捕捉视频理解的这一核心方面。为填补这一空白,我们提出VRR-QA,这是一个超越显式线索的视觉关系推理基准测试。我们从创意和电影类视频中构建基准测试,这些视频刻意采用叙事手法,省略直接呈现某些事件或关系,要求观众推断。VRR-QA包含1000个由专家精准标注的问答对,涵盖1000段15种类型、跨越7个 decade 的创意视频片段,包含实拍和动画作品。我们对14个领先的VideoQA模型进行大规模评估,发现性能持续且显著下降,凸显模型依赖表层视觉线索,突显隐式推理的难度。即便是最佳模型也仅达到64%的准确率,显著低于人类基线。模型间的性能差异进一步说明VRR-QA所揭示的挑战具有复杂性和多样性。通过发布数据集和数据收集框架,VRR-QA建立了一个严谨、多样且可复现的测试平台,推动VideoQA的发展:https://swetha5.github.io/ImplicitQA/。
引用
@article{arxiv.2506.21742,
title = {VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues},
author = {Sirnam Swetha and Rohit Gupta and Parth Parag Kulkarni and David G Shatwell and Jeffrey A Chan Santiago and Nyle Siddiqui and Joseph Fioresi and Mubarak Shah},
journal= {arXiv preprint arXiv:2506.21742},
year = {2026}
}
备注
Accepted at CVPR 2026