MambaVision:一种混合Mamba-Transformer视觉骨干网络
计算机视觉与模式识别
2025-03-26 v2
摘要
我们提出一种新型混合Mamba-Transformer骨干网络,命名为MambaVision,专为视觉应用而设计。我们的核心贡献在于重新设计Mamba模型的表述,以提升其高效建模视觉特征的能力。通过系统消融研究,我们证明了将视觉Transformer(ViT)与Mamba集成的可行性。实验表明,在网络后期加入自注意力模块可显著提升其捕获长程空间依赖关系的能力。基于此,我们构建了具层次结构的MambaVision模型系列,以满足不同设计需求。在ImageNet-1K数据集上的分类任务中,MambaVision变体在Top-1准确率与吞吐量方面均实现最先进(SOTA)性能。在下游任务(如MS COCO和ADE20K数据集上的目标检测、实例分割与语义分割)中,MambaVision在相当于规模的骨干网络上表现优异,性能具有优势。代码:https://github.com/NVlabs/MambaVision
引用
@article{arxiv.2407.08083,
title = {MambaVision: A Hybrid Mamba-Transformer Vision Backbone},
author = {Ali Hatamizadeh and Jan Kautz},
journal= {arXiv preprint arXiv:2407.08083},
year = {2025}
}
备注
Accepted to CVPR'25