中文

静态还是动态:面向视频问答的查询自适应标记选择策略

计算机视觉与模式识别 2025-09-16 v2

摘要

视频问答利用视频中的丰富信息具有多种应用前景。然而,来自长视频的大量标记对内存效率和模型性能构成挑战。为缓解此问题,现有工作提出压缩视频输入的方法,但常常忽略不同查询下静态信息和动态信息的重要性差异,导致在有限预算内的标记使用效率低下。我们提出一种新颖的标记选择策略,textsc{explore-then-select},根据问题要求自适应调整静态和动态信息。我们的框架首先探索关键帧(保留空间细节)与增量帧(捕捉时间变化)之间的不同标记分配方案。随后采用查询感知的注意力机制指标,在不进行模型更新的情况下选择最优的标记组合。我们的框架具有即插即用的特性,可无缝集成到多种视频语言模型中。大量实验表明,我们的方法在多个视频问答基准测试上实现了显著的性能提升(最高达 5.8%)。我们的代码已公开于 https://github.com/ANDgate99/Explore-Then-Select。

关键词

引用

@article{arxiv.2504.21403,
  title  = {Static or Dynamic: Towards Query-Adaptive Token Selection for Video Question Answering},
  author = {Yumeng Shi and Quanyu Long and Wenya Wang},
  journal= {arXiv preprint arXiv:2504.21403},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 (main)