基于收集与扩散时空信息的状态空间提示用于视频理解
计算机视觉与模式识别
2025-10-15 v1
摘要
最近,预训练的状态空间模型在视频分类方面显示出巨大的潜力,这些模型以线性复杂度顺序压缩视频中的视觉标记,从而提高了视频数据处理效率,同时保持高性能。为了将强大的预训练模型应用于下游任务,提出了提示学习,以仅微调少量参数实现高效的下游任务适应。然而,顺序压缩的视觉提示标记未能捕获视频中空间和时间上下文信息,从而限制了在状态压缩模型和视觉提示标记之间有效传播空间信息以及在帧之间传播时间信息的能力,从而限制了判别性信息的提取。为解决上述问题,我们提出了一种状态空间提示 (SSP) 方法用于视频理解,该方法结合了帧内提示和帧间提示,以聚合和传播视频中的关键时空信息。具体而言,我们设计了一种帧内收集 (IFG) 模块,用于聚合每个帧内的空间关键信息。此外,我们设计了一种帧间扩散 (IFS) 模块,用于在不同帧之间扩散判别性时空信息。通过自适应平衡和压缩帧内外关键时空信息,SSP 有效地以互补方式传播视频中的判别性信息。广泛的实验在四个视频基准数据集上验证了 SSP 相较于现有 SOTA 方法平均提升了 2.76%,同时大幅降低了微调参数的开销。
引用
@article{arxiv.2510.12160,
title = {State Space Prompting via Gathering and Spreading Spatio-Temporal Information for Video Understanding},
author = {Jiahuan Zhou and Kai Zhu and Zhenyu Cui and Zichen Liu and Xu Zou and Gang Hua},
journal= {arXiv preprint arXiv:2510.12160},
year = {2025}
}