中文

视频-大语言模型回答视频问题的实证研究

计算机视觉与模式识别 2025-08-22 v1

摘要

借助大规模数据和预训练语言模型,视频大语言模型(Video-LLMs)在回答视频问题方面展现出强大的能力。然而,现有研究主要致力于提升性能,却有限量关注理解其内部机制。本文通过系统实证研究弥合这一差距。为解释现有 VideoLLMs,我们采用注意力消除作为主要分析工具,设计了三个变体:视频时间消除、视频空间消除和语言导向视频消除。随后,我们将这些三种消除方法应用于不同层数(层窗口)的模型上。通过严格控制层窗口和消除类型,我们提供了两个设置:全局设置与细粒度设置。我们的研究揭示了三个关键发现:(1)全局设置表明视频信息提取主要发生在早期层,形成明确的两阶段过程——下层关注感知编码,而上层处理抽象推理;(2)在细粒度设置中,某些中间层对视频问答产生 outsized 影响,充当关键离群点,而大多数其他层贡献微小;(3)在两种设置中,我们观察到空间时间建模更依赖于语言导向检索,而非视频标记之间的自注意力(包括帧间和帧内),尽管后者计算成本高昂。最后,我们展示这些洞见可用于降低 Video-LLMs 的注意力计算。据我们了解,这是首个系统揭示 Video-LLMs 如何内部处理和理解视频内容的工作,为未来研究提供了解译性和效率视角。

关键词

引用

@article{arxiv.2508.15360,
  title  = {An Empirical Study on How Video-LLMs Answer Video Questions},
  author = {Chenhui Gou and Ziyu Ma and Zicheng Duan and Haoyu He and Feng Chen and Akide Liu and Bohan Zhuang and Jianfei Cai and Hamid Rezatofighi},
  journal= {arXiv preprint arXiv:2508.15360},
  year   = {2025}
}