面向长视频理解的选择性结构化状态空间
计算机视觉与模式识别
2023-03-28 v1
摘要
对长视频中复杂时空依赖关系的有效建模仍是一个开放问题。近期提出的结构化状态空间序列(S4)模型以其线性复杂度在这一方向展现出前景。然而,我们证明,S4 模型那样将所有图像 token 同等对待会对效率与精度产生不利影响。为应对该局限,我们提出一种新颖的选择性 S4(即 S5)模型,其采用轻量掩码生成器自适应地选择信息性图像 token,从而实现对视频中长期时空依赖关系更高效且更精确的建模。不同于先前 transformer 中使用的基于掩码的 token 缩减方法,我们的 S5 模型借助动量更新的 S4 模型之引导,避免了稠密自注意力计算。这使得我们的模型能高效丢弃信息量较低的 token,并更有效地适配各类长视频理解任务。然而,与多数 token 缩减方法一样,信息性图像 token 可能被错误丢弃。为提升模型的鲁棒性与时间跨度,我们提出一种新颖的长短掩码对比学习(LSMCL)方法,使模型能用更短的输入视频预测更长的时序上下文。我们利用三个具挑战性的长视频理解数据集(LVU、COIN 和 Breakfast)给出大量对比结果,表明我们的方法以高达 9.6% 的精度优势持续优于先前 SOTA 的 S4 模型,同时将其内存占用降低 23%。
引用
@article{arxiv.2303.14526,
title = {Selective Structured State-Spaces for Long-Form Video Understanding},
author = {Jue Wang and Wentao Zhu and Pichao Wang and Xiang Yu and Linda Liu and Mohamed Omar and Raffay Hamid},
journal= {arXiv preprint arXiv:2303.14526},
year = {2023}
}
备注
Accepted by CVPR 2023