中文

基于事件引导的视频大语言模型高效时空理解:EventSTU

计算机视觉与模式识别 2025-11-25 v1

摘要

视频大语言模型已展示出强大的视频理解能力,但因长视频中token的大量存在,在推理时面临高昂的计算成本。受基于事件的视觉灵感启发,我们提出一种基于事件引导的、训练无关的高效时空理解框架,命名为EventSTU。在时域上,我们设计了一种粗到细的关键帧采样算法,利用事件相机的变更触发特性消除冗余帧。在空间域上,我们设计了一种自适应token剪枝算法,利用事件的视觉显著性作为零成本先验来指导空间减率。就整体时空视角而言,我们进一步将问题相关性整合到关键帧采样中,以自适应分配token剪枝预算。为便于评估,我们构建了EventBench,第一个包含事件的、人工标注的多模态基准,涵盖多种真实场景。除了物理事件相机之外,EventSTU还支持使用模拟事件的通用视频理解。全面实验表明,EventSTU在最强基准上实现了3.01倍的FLOPs降低和3.10倍的预填充加速,同时仍提升了性能。

关键词

引用

@article{arxiv.2511.18920,
  title  = {EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models},
  author = {Wenhao Xu and Xin Dong and Yue Li and Haoyuan Shi and Zhiwei Xiong},
  journal= {arXiv preprint arXiv:2511.18920},
  year   = {2025}
}

备注

8 pages, 7 figures