中文

VideoMamba:用于高效视频理解的状态空间模型

计算机视觉与模式识别 2024-03-13 v2

摘要

为解决视频理解中局部冗余和全局依赖关系的双重挑战,本工作创新性地将Mamba模型适用于视频领域。提出的VideoMamba克服了现有3D卷积神经网络和视频变换器的局限性。其线性复杂度算子实现了高效的长期建模,这对于高分辨率长视频理解至关重要。广泛的评估表明,VideoMamba具备四项核心能力:(1) 由于新颖的自蒸馈技术,无需大规模数据预训练即可实现视觉领域的可扩展性;(2) 对识别细粒度运动差异的短期动作具有高度灵敏度;(3) 在长期视频理解方面优于传统基于特征的方法,取得显著进展;(4) 与其他模态的兼容性表明其在多模态环境中的鲁棒性。凭借这些独特优势,VideoMamba为视频理解树立了新基准,为综合性视频理解提供了可扩展且高效的解决方案。所有代码和模型均可在 https://github.com/OpenGVLab/VideoMamba 获取。

关键词

引用

@article{arxiv.2403.06977,
  title  = {VideoMamba: State Space Model for Efficient Video Understanding},
  author = {Kunchang Li and Xinhao Li and Yi Wang and Yinan He and Yali Wang and Limin Wang and Yu Qiao},
  journal= {arXiv preprint arXiv:2403.06977},
  year   = {2024}
}

备注

19 Pages, 7 Figures, 8 Tables