基于状态空间视频模型的长电影片段分类
计算机视觉与模式识别
2023-01-05 v3
摘要
大多数现代视频识别模型设计用于短时视频片段(例如长度为5-10秒)。因此,将此类模型应用于长电影理解任务具有挑战性,后者通常需要复杂的长程时序推理。最近引入的视频 Transformer 通过长程时序自注意力部分解决了该问题。然而,由于自注意力的二次方代价,此类模型通常代价高昂且不便实用。相反,我们提出 ViS4mer,一种高效的长程视频模型,它结合了自注意力与最近引入的结构化状态空间序列(S4)层的优势。我们的模型使用标准 Transformer 编码器进行短程时空特征提取,并使用多尺度时序 S4 解码器进行后续长程时序推理。通过在每个解码器层逐步降低时空特征分辨率和通道维度,ViS4mer 学习视频中复杂的长程时空依赖。此外,ViS4mer 比相应的纯自注意力模型快 且所需 GPU 内存减少 。另外,ViS4mer 在 Long Video Understanding(LVU)基准的 个长格式电影视频分类任务中的 个上取得了最先进结果。此外,我们展示了我们的方法能成功泛化到其他领域,在 Breakfast 和 COIN 程序性活动数据集上取得了有竞争力的结果。代码公开于:https://github.com/md-mohaiminul/ViS4mer。
引用
@article{arxiv.2204.01692,
title = {Long Movie Clip Classification with State-Space Video Models},
author = {Md Mohaiminul Islam and Gedas Bertasius},
journal= {arXiv preprint arXiv:2204.01692},
year = {2023}
}
备注
Accepted by ECCV 2022