PKS$^4$:平行运动选择性状态空间扫描器用于高效视频理解
计算机视觉与模式识别
2026-04-30 v1
摘要
视频理解中的时序建模在序列长度扩大时仍是根本挑战,尤其是当视频变长时。传统视频模型依赖稠密时空注意力,面对长视频时计算复杂度呈二次增长。为规避此种开销,近期方法通过参数高效微调(PEFT)等方式将图像模型用于视频处理,如插入适配器模块。但深层插入这些模块在反向传播期间会产生巨大的激活内存开销。虽然近期的高效状态空间模型(SSM)引入线性复杂度,但它们破坏了 2D 空间关系,依赖大量遮蔽预训练来恢复空间感知能力。为克服这些限制,我们提出平行运动选择性状态空间扫描器(PKS)。我们保留标准 2D 视觉 backbone 用于空间语义,插入单个即插即用 PKS 模块,实现线性复杂度时序扫描,避免时序注意力和多层适配器。我们首先通过 Kinematic Prior Encoder 提取运动先验,该编码器通过帧间相关性和差异捕获局部位移和运动边界。这些先验驱动线性复杂度 SSM 跟踪底层运动状态,自适应调节每个时间步的更新速度和读写策略。我们沿时间维度为每个空间位置部署平行扫描器,保留空间结构的同时降低开销。在空间密集和时间密集动作识别基准测试上进行实验,表明 PKS 实现了最先进的性能。值得注意的是,我们的方法仅需 20 个 epoch 即可收敛,训练计算量约为纯视频 SSM 的 10 倍,开创了高效视频理解的新范式。
引用
@article{arxiv.2604.26461,
title = {$\text{PKS}^4$:Parallel Kinematic Selective State Space Scanners for Efficient Video Understanding},
author = {Lingjie Zeng and Hailun Zhang and Xiwen Wang and Qijun Zhao},
journal= {arXiv preprint arXiv:2604.26461},
year = {2026}
}