中文

自反式长视频理解的大型视觉语言模型

计算机视觉与模式识别 2025-06-30 v2

摘要

大型视觉语言模型(LVLMs)在短视频任务(如视频问答)中表现突出,但在长视频理解方面存在挑战。传统LVLMs使用的线性帧采样策略未能考虑到视频数据中关键事件的非线性分布,往往在较长的上下文中引入冗余或无关信息,同时风险漏掉较短情节中的关键事件。为此,我们提出了SelfReS——一种基于用户提示动态选择关键视频片段的非线性时空自反采样方法。与先前方法不同,SelfReS利用LVLMs内在的稀疏注意力图定义反射标记,实现无需额外训练或外部模块的相关性感知标记选择。实验表明,SelfReS可无缝集成到强大的基础LVLMs中,提升长视频任务准确率,并在相同GPU内存预算下实现最高46%的推理速度提升。

关键词

引用

@article{arxiv.2503.20362,
  title  = {Self-ReS: Self-Reflection in Large Vision-Language Models for Long Video Understanding},
  author = {Joao Pereira and Vasco Lopes and David Semedo and Joao Neves},
  journal= {arXiv preprint arXiv:2503.20362},
  year   = {2025}
}