VideoMamba:时空选择性状态空间模型
计算机视觉与模式识别
2024-07-12 v1
摘要
我们提出 VideoMamba,这是一种针对视频识别任务的纯 Mamba 架构的新型适配。不同于依赖自注意力机制导致计算成本呈二次方复杂度的 Transformer,VideoMamba 利用 Mamba 的线性复杂度和选择性 SSM mechanism 实现更高效的处理。 proposed 的时空前向和逆向 SSM 允许模型有效捕捉非序列化空间信息与序列化时间信息之间复杂关系。因此,VideoMamba 不仅在资源效率方面具有优势,还能有效捕捉视频中的长程依赖,在各种视频理解基准测试中展现出具竞争力的性能和卓越的效率。我们的工作凸显了 VideoMamba 作为视频理解强大工具的潜力,为未来的视频分析研究提供了一个简单而有效的基线。
关键词
引用
@article{arxiv.2407.08476,
title = {VideoMamba: Spatio-Temporal Selective State Space Model},
author = {Jinyoung Park and Hee-Seon Kim and Kangwook Ko and Minbeom Kim and Changick Kim},
journal= {arXiv preprint arXiv:2407.08476},
year = {2024}
}
备注
ECCV 2024. code available at http://github.com/jinyjelly/VideoMamba