Mamba-R:视觉Mamba也需要寄存器
计算机视觉与模式识别
2025-06-02 v2
摘要
本文类似于视觉Transformer,识别了视觉Mamba特征图中也存在的类生成物。这些类生成物对应的是在图像低信息背景区域出现的高范数token,在视觉Mamba中表现得比视觉Transformer更为严重——即使是小型模型也普遍存在,并且在背景区域激活广泛。为缓解此问题,我们遵循在视觉Mamba中引入寄存器token的先前解决方案。为更好地应对Mamba块的单向推断范式,本文引入两个关键修改:1)在输入token序列中均匀插入寄存器,以及2)为最终决策预测循环使用寄存器。我们称这种新的架构为Mamba-R。定性观察表明,与原始视觉Mamba相比,Mamba-R的特征图更干净、更专注于语义上有意义的区域。定量上,Mamba-R获得了更强的性能并表现出更好的扩展性。例如,在ImageNet基准测试上,我们的base大小Mamba-R获得了83.0%的准确率,显著优于Vim-B的81.8%;此外,我们首次成功实现了大型模型(即3.41亿参数)的扩展,达到竞争性的83.6%准确率(若使用384×384输入微调则达到84.5%)。对下游语义分割任务的额外验证也支持Mamba-R的有效性。代码可在https://github.com/wangf3014/Mamba-Reg获取。
引用
@article{arxiv.2405.14858,
title = {Mamba-R: Vision Mamba ALSO Needs Registers},
author = {Feng Wang and Jiahao Wang and Sucheng Ren and Guoyizhe Wei and Jieru Mei and Wei Shao and Yuyin Zhou and Alan Yuille and Cihang Xie},
journal= {arXiv preprint arXiv:2405.14858},
year = {2025}
}
备注
Published in CVPR 2025