中文

STOP: 集成时空动态提示用于视频理解

计算机视觉与模式识别 2025-03-26 v2

摘要

基于大量图像-文本对进行预训练的视觉语言模型(如 CLIP)在诸多基于图像的任务上展现了良好的零样本泛化能力。然而,将这些能力扩展到视频任务仍面临数据有限和高训练成本的挑战。近期的视频提示方法试图通过引入可学习的提示来适配 CLIP 以适用于视频任务,但它们通常依赖于针对所有视频序列的单一静态提示,忽略了帧之间存在的多样化时序动态和空间变化。这种局限显著阻碍了模型捕捉有效视频理解所必需的关键时序信息的能力。为此,我们提出了由两个互补模块构成的集成时空动态提示 (STOP) 模型,即帧内空间提示和帧间时序提示。我们的帧内空间提示通过利用帧内注意力和时序变化,设计用于适应地突出显示每个帧中判别性强的区域,使模型能够关注具有显著时序动态的区域,并捕捉细粒度的空间细节。此外,为突出显示帧在视频理解中的重要性,我们进一步引入帧间时序提示,根据帧相似性度量后的时序方差,动态在帧之间插入提示。这使模型能够优先处理关键帧,增强其理解序列中时序依赖关系的能力。在Various视频基准上的大量实验表明,STOP consistently 优于当前最先进的方法。代码已公开于 https://github.com/zhoujiahuan1991/CVPR2025-STOP。

关键词

引用

@article{arxiv.2503.15973,
  title  = {STOP: Integrated Spatial-Temporal Dynamic Prompting for Video Understanding},
  author = {Zichen Liu and Kunlun Xu and Bing Su and Xu Zou and Yuxin Peng and Jiahuan Zhou},
  journal= {arXiv preprint arXiv:2503.15973},
  year   = {2025}
}