Video Mamba Suite:将状态空间模型作为视频理解的通用替代方案
计算机视觉与模式识别
2024-03-15 v1
摘要
视频理解是计算机视觉研究中的一个基本方向,旨在探索各种架构(如 RNN、3D CNN 和 Transformer)以适应视频建模。新近提出的状态空间模型(例如 Mamba)显示出将长序列建模成功扩展到视频建模的潜在优势。为评估 Mamba 是否可作为 Transformer 在视频理解领域的可行替代方案,本文系统地研究了 Mamba 在建模视频中可发挥的不同角色,同时探讨了 Mamba 能表现优势的多样任务。我们将 Mamba 分类为视频建模的四种角色,构建由 14 个模型/模块组成的 Video Mamba Suite,并在 12 个视频理解任务上进行评估。我们的大量实验结果表明,Mamba 在视频-only 和视频语言任务上都具有强大的潜力,同时在效率与性能之间展现出有前景的权衡。我们希望本工作为未来视频理解研究提供有价值的数据点和见解。代码已公开:https://github.com/OpenGVLab/video-mamba-suite。
引用
@article{arxiv.2403.09626,
title = {Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding},
author = {Guo Chen and Yifei Huang and Jilan Xu and Baoqi Pei and Zhe Chen and Zhiqi Li and Jiahao Wang and Kunchang Li and Tong Lu and Limin Wang},
journal= {arXiv preprint arXiv:2403.09626},
year = {2024}
}
备注
Technical Report