中文

GLIMPSE:大型视觉-语言模型是否真正能“思考”视频,还是仅仅“眺望”视频?

计算机视觉与模式识别 2025-07-15 v1

摘要

现有的视频基准常像图像基准,问题类型如“该执行者在整个视频中执行哪些动作?”或“视频中女人的裙子是什么颜色?”。对于这些问题,模型通常可以通过扫描几个关键帧就能回答,而无需深入的时间推理。这限制了我们判断大型视觉-语言模型(LVLMs)是否能真正“思考”视频而不仅仅进行浅层帧级分析的能力。为此,我们引入 GLIMPSE,一个专为评估 LVLMs 是否能真正“思考”视频而设计的基准。不同于先前的基准,GLIMPSE 强调超越静态图像线索的全面视频理解。它包含 3,269 个视频和 4,342 个高度以视觉为中心的问题,涵盖 11 个类别,包括轨迹分析、时间推理和 Forensic 检测。所有问题都由人工标注者仔细构建,需要观看整个视频并对完整视频上下文进行推理——这就是我们所说的“思考视频”。这些问题无法通过扫描所选帧或仅靠文本来回答。在人类评估中,GLIMPSE 达到了 94.82% 的准确率,但当前 LVLMs 面临重大挑战。即使是表现最好的模型 GPT-o3 也仅达到 66.43%,这表明 LVLMs 仍然难以超越表层推理,真正“思考”视频。

关键词

引用

@article{arxiv.2507.09491,
  title  = {GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?},
  author = {Yiyang Zhou and Linjie Li and Shi Qiu and Zhengyuan Yang and Yuyang Zhao and Siwei Han and Yangfan He and Kangqi Li and Haonian Ji and Zihao Zhao and Haibo Tong and Lijuan Wang and Huaxiu Yao},
  journal= {arXiv preprint arXiv:2507.09491},
  year   = {2025}
}

备注

15 pages, 10 figures