中文

Vision Mamba:基于双向状态空间模型的高效视觉表示学习

计算机视觉与模式识别 2024-11-15 v3 机器学习

摘要

最近,具有高效硬件感知设计的状态空间模型(SSMs),即 Mamba 深度学习模型,在长序列建模方面显示出巨大潜力。同时,完全基于 SSM 构建高效且通用的视觉骨干网络是一个诱人的方向。然而,由于视觉数据的位置敏感性以及视觉理解对全局上下文的需求,SSM 在表示视觉数据方面面临挑战。在本文中,我们表明视觉表示学习并不必须依赖自注意力机制,并提出了一种带有双向 Mamba 块(Vim)的新通用视觉骨干网络,该网络使用位置嵌入标记图像序列,并利用双向状态空间模型压缩视觉表示。在 ImageNet 分类、COCO 目标检测和 ADE20k 语义分割任务上,Vim 相比 DeiT 等成熟的视觉 Transformer 实现了更高的性能,同时也展示了显著的计算和内存效率提升。例如,在对分辨率为 1248×1248 的图像进行批量推理以提取特征时,Vim 比 DeiT 快 2.8 倍,并节省了 86.8% 的 GPU 内存。结果表明,Vim 能够克服对高分辨率图像执行 Transformer 风格理解时的计算和内存限制,并有望成为下一代视觉基础模型的骨干网络。代码可在 https://github.com/hustvl/Vim 获取。

关键词

引用

@article{arxiv.2401.09417,
  title  = {Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model},
  author = {Lianghui Zhu and Bencheng Liao and Qian Zhang and Xinlong Wang and Wenyu Liu and Xinggang Wang},
  journal= {arXiv preprint arXiv:2401.09417},
  year   = {2024}
}

备注

Vision Mamba (Vim) is accepted by ICML 2024. Code is available at https://github.com/hustvl/Vim