中文

V2M:用于图像表示学习的视觉二维 Mamba

计算机视觉与模式识别 2024-10-15 v1

摘要

Mamba 因其灵活的设计和高效硬件性能而广受欢迎,可处理基于状态空间模型(SSM)的 1D 序列。最近的研究尝试将 Mamba 应用于视觉领域,通过展平 2D 图像为补丁,然后将其视为 1D 序列。为补偿原始图像(如局部相似性)丢失的 2D 结构信息,大多数现有方法侧重于设计不同的顺序来顺序处理标记,这只能在某种程度上缓解此问题。本文提出了一种 Visual 2-Dimensional Mamba(V2M)模型作为完整解决方案,直接在 2D 空间中处理图像标记。我们首先将 SSM 推广到 2 维空间,以两个相邻状态在两个维度(例如列和行)上的情况来生成下一个状态。我们随后在 2 维 SSM 公式的基础上构建 V2M,并将 Mamba 纳入其中以实现硬件高效的并行处理。所提出的 V2M 有效地包含了 2D 局部性先验,同时保留了 Mamba 的效率和输入依赖可扩展性。在 ImageNet 分类以及面向下游视觉任务的大量实验结果中,包括在 COCO 上的目标检测和实例分割以及在 ADE20K 上的语义分割,均表明 V2M 在其他视觉骨干网络方面具有有效性。

关键词

引用

@article{arxiv.2410.10382,
  title  = {V2M: Visual 2-Dimensional Mamba for Image Representation Learning},
  author = {Chengkun Wang and Wenzhao Zheng and Yuanhui Huang and Jie Zhou and Jiwen Lu},
  journal= {arXiv preprint arXiv:2410.10382},
  year   = {2024}
}