中文

Q-Bench-Video:用于评估大型多模态模型视频质量理解基准

计算机视觉与模式识别 2025-03-04 v2

摘要

随着对大型多模态模型 (LMMs) 用于视频理解的研究兴趣上升,许多研究强调了一般视频理解能力,忽略了对视频质量理解的系统性探索。为此,本文引入 Q-Bench-Video,一个专门用于评估 LMMs 辨别视频质量能力的新基准。为确保视频来源的多样性,Q-Bench-Video 包含来自自然场景、人工智能生成内容 (AIGC) 和计算机图形 (CG) 的视频。基于传统的多选题格式加入 Yes-or-No 和 What-How 类别,我们包含开放式问题以更好地评估复杂情境。此外,我们还Incorporate了视频对比质量比较问题以增强全面性。除了传统的技术、审美和时间失真维度,我们还扩展了 AIGC 失真维度,以应对日益增长的视频生成需求。最终我们收集了 2,378 个问答对,并在 12 个开源模型和 5 个专有模型上进行测试。我们的发现表明,尽管 LMMs 具备基本的视频质量理解能力,但其表现仍不完整且不够精确,与人类水平之间存在显著差异。通过 Q-Bench-Video,我们希望引发社区兴趣,激发进一步的研究,并发掘 LMMs 在视频质量理解方面的潜力。

关键词

引用

@article{arxiv.2409.20063,
  title  = {Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs},
  author = {Zicheng Zhang and Ziheng Jia and Haoning Wu and Chunyi Li and Zijian Chen and Yingjie Zhou and Wei Sun and Xiaohong Liu and Xiongkuo Min and Weisi Lin and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2409.20063},
  year   = {2025}
}