中文

基于状态空间视频模型的长电影片段分类

计算机视觉与模式识别 2023-01-05 v3

摘要

大多数现代视频识别模型设计用于短时视频片段(例如长度为5-10秒)。因此,将此类模型应用于长电影理解任务具有挑战性,后者通常需要复杂的长程时序推理。最近引入的视频 Transformer 通过长程时序自注意力部分解决了该问题。然而,由于自注意力的二次方代价,此类模型通常代价高昂且不便实用。相反,我们提出 ViS4mer,一种高效的长程视频模型,它结合了自注意力与最近引入的结构化状态空间序列(S4)层的优势。我们的模型使用标准 Transformer 编码器进行短程时空特征提取,并使用多尺度时序 S4 解码器进行后续长程时序推理。通过在每个解码器层逐步降低时空特征分辨率和通道维度,ViS4mer 学习视频中复杂的长程时空依赖。此外,ViS4mer 比相应的纯自注意力模型快 2.63×2.63\times 且所需 GPU 内存减少 8×8\times。另外,ViS4mer 在 Long Video Understanding(LVU)基准的 99 个长格式电影视频分类任务中的 66 个上取得了最先进结果。此外,我们展示了我们的方法能成功泛化到其他领域,在 Breakfast 和 COIN 程序性活动数据集上取得了有竞争力的结果。代码公开于:https://github.com/md-mohaiminul/ViS4mer。

关键词

引用

@article{arxiv.2204.01692,
  title  = {Long Movie Clip Classification with State-Space Video Models},
  author = {Md Mohaiminul Islam and Gedas Bertasius},
  journal= {arXiv preprint arXiv:2204.01692},
  year   = {2023}
}

备注

Accepted by ECCV 2022