中文

VCMamba:通过多方向 Mamba 桥接卷积以实现高效视觉表示

计算机视觉与模式识别 2025-09-08 v1 人工智能 机器学习

摘要

Vision Transformers (ViTs) 与 State Space Models (SSMs) 的最新进展挑战了 Convolutional Neural Networks (CNNs) 在计算机视觉中的主导地位。ViTs 擅长捕获全局上下文,而诸如 Mamba 之类的 SSMs 为长序列提供了线性复杂度,但它们在捕获细粒度局部特征方面不如 CNNs 有效。反之,CNNs 对局部特征具有强的归纳偏置,但缺乏 transformers 和 Mamba 的全局推理能力。为弥合这一差距,我们引入了 \textit{VCMamba},一种融合了 CNNs 与多方向 Mamba SSMs 优势的新型视觉主干网络。VCMamba 采用卷积主干和早期阶段包含卷积块的分层结构,以提取丰富的局部特征。随后,这些卷积块由包含多方向 Mamba 块的后期阶段处理,旨在高效地对长程依赖和全局上下文进行建模。这种混合设计在保持相对于图像分辨率线性复杂度的同时,实现了卓越的特征表示。我们通过在 ImageNet-1K 分类和 ADE20K 语义分割上的大量实验证明了 VCMamba 的有效性。我们的 VCMamba-B 在 ImageNet-1K 上实现了 82.6% 的 top-1 准确率,以减少 37% 的参数超越了 PlainMamba-L3 0.3%,并以减少 64% 的参数超越了 Vision GNN-B 0.3%。此外,VCMamba-B 在 ADE20K 上获得了 47.1 mIoU,以减少 62% 的参数超越了 EfficientFormer-L7 2.0 mIoU。代码可在 https://github.com/Wertyuui345/VCMamba 获取。

关键词

引用

@article{arxiv.2509.04669,
  title  = {VCMamba: Bridging Convolutions with Multi-Directional Mamba for Efficient Visual Representation},
  author = {Mustafa Munir and Alex Zhang and Radu Marculescu},
  journal= {arXiv preprint arXiv:2509.04669},
  year   = {2025}
}

备注

Proceedings of the 2025 IEEE/CVF International Conference on Computer Vision (ICCV) Workshops