中文

动态视觉Mamba

计算机视觉与模式识别 2025-04-08 v1 人工智能

摘要

Mamba-based视觉模型因其比注意力模型更具计算效率而受到广泛关注。然而,这些模型仍存在空间冗余,表现为token和block冗余。对于token冗余,我们分析发现,早期的token剪枝方法会导致训练与推理不一致,或在推理时引入额外计算。因此,我们针对Mamba结构定制了token剪枝,通过重新排列被剪枝的序列以适应后续Mamba模块的输入。对于block冗余,我们根据经验观察到Mamba-based视觉模型的推理速度主要取决于SSM模块的数量,允许每个图像根据实际情况动态选择所需的SSM模块。我们提出的方法——动态视觉Mamba(DyVM)——通过少量精度损失有效降低FLOPs。在Vim-S上,DyVM实现了35.2%的FLOPs降低,仅损失1.7%的准确率。该方法在不同的Mamba视觉模型架构和不同的视觉任务上都表现出良好的泛化能力。我们的代码将公开。

关键词

引用

@article{arxiv.2504.04787,
  title  = {Dynamic Vision Mamba},
  author = {Mengxuan Wu and Zekai Li and Zhiyuan Liang and Moyang Li and Xuanlei Zhao and Samir Khaki and Zheng Zhu and Xiaojiang Peng and Konstantinos N. Plataniotis and Kai Wang and Wangbo Zhao and Yang You},
  journal= {arXiv preprint arXiv:2504.04787},
  year   = {2025}
}