中文

Video SimpleQA:面向大型视频语言模型的事实性评估

计算机视觉与模式识别 2025-08-14 v2

摘要

近期大型视频语言模型(LVLMs)的快速发展凸显了其在多模态理解方面的潜力,但评估其在视频情境下的事实性 grounding 仍然是一项尚未解决的关键挑战。为此,我们引入 Video SimpleQA,这是首个针对视频情境事实性评估的全面基准测试。我们的工作与现有视频基准测试不同,主要体现在以下几个关键方面:1)所需知识:要求整合视频之外的外部知识;2)多跳事实寻求问题:每个问题都涉及多个明确事实,要求严格的事实 grounding,不能进行假设或主观推断。我们还包括基于单跳单事实子问答,以实现细粒度、逐步评估;3)短小且确定性答案:答案被设计为明确且正确的短格式,最小化评分方差;4)要求时空 grounding:要求答案依赖于视频的一个或多个时间段,而非单个画面。我们广泛评估了 33 个最先进的 LVLMs,并总结了关键发现如下:1)当前 LVLMs 在事实遵从性方面存在显著不足,最佳模型 o3 仅达 F 分数66.3%;2)大多数 LVLMs 对所生成内容显得过于自信,自述的置信度超过实际准确率;3)检索增强生成在推理时间开销之外表现出一致的改进;4)多跳问答的性能显著低于单跳子问答,首跳对象或事件识别成为主要瓶颈。我们将 Video SimpleQA 定位为视频事实性评估的基石基准,旨在引导 LVLMs 发展向现实情境中的可验证性 grounding 方向。

关键词

引用

@article{arxiv.2503.18923,
  title  = {Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models},
  author = {Meng Cao and Pengfei Hu and Yingyao Wang and Jihao Gu and Haoran Tang and Haoze Zhao and Chen Wang and Jiahua Dong and Wangbo Yu and Ge Zhang and Jun Song and Xiang Li and Bo Zheng and Ian Reid and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2503.18923},
  year   = {2025}
}