中文

ShotBench:视觉语言模型中的专家水平电影镜头理解

计算机视觉与模式识别 2026-03-31 v2

摘要

电影摄影是电影中传递叙事、情感和审美质量的基本视觉语言。尽管近期的视觉语言模型(VLM)在一般视觉理解方面表现突出,但其在理解单个镜头中嵌入的细腻电影语法方面的专业能力仍基本未被探索且缺乏稳健的评估。这一关键缺口限制了细粒度视觉理解和 AI 辅助视频生成的精度。为此,我们引入 ShotBench,这是针对电影语言理解设计的全面基准测试。它包含来自超过 200 部著名(主要为获奖提名)电影中超过 3500 个专家标注的 QA 对,涵盖电影摄影的八个关键维度。我们对 ShotBench 上 24 家领先 VLM 的评估显示其显著局限:即便是表现最好的模型在平均准确率上也不到 60%,尤其在细粒度视觉线索和复杂空间推理方面表现较差。为推动该领域发展,我们构建了 ShotQA,一个大规模多模态数据集,包含约 7 万个电影 QA 对。利用 ShotQA,我们通过监督微调和 Group Relative Policy Optimization 开发了 ShotVL。ShotVL 在 ShotBench 上显著优于所有现有开源和专有模型,树立了新的最佳性能。我们开源模型、数据和代码,以促进该领域人工智能驱动的电影理解和生成的快速进展。

关键词

引用

@article{arxiv.2506.21356,
  title  = {ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models},
  author = {Hongbo Liu and Jingwen He and Yi Jin and Dian Zheng and Yuhao Dong and Fan Zhang and Ziqi Huang and Yinan He and Yangguang Li and Weichao Chen and Yu Qiao and Wanli Ouyang and Shengjie Zhao and Ziwei Liu},
  journal= {arXiv preprint arXiv:2506.21356},
  year   = {2026}
}