Mamba-R:视觉 Mamba 也需要寄存器
计算机视觉与模式识别
2024-10-03 v3 人工智能
机器学习
摘要
本文指出,类似视觉 Transformer 的视觉 Mamba 也存在相应的特征图 artifact。这些 artifact 对应于在图像低信息背景区域出现的高范数 token,在视觉 Mamba 中表现更为严重——即便是小型模型也普遍存在,且在背景区域激活广泛。为缓解此问题,我们遵循引入寄存器 token 于视觉 Mamba 的先前方案。为更好地适应 Mamba 块的单向推理范式,本文引入两个关键修改:1)在输入 token 序列中均匀插入寄存器;2)循环使用寄存器用于最终决策预测。我们称其为新的架构 Mamba-R。定性观察表明,与纯粹的视觉 Mamba 相比,Mamba-R 的特征图更干净、更专注于语义有意义区域。定量上,Mamba-R 在各项指标上表现更强,规模化效果更佳。例如,在 ImageNet 基准测试中,我们的 base 大小 Mamba-R 达到 83.0% 的准确率,显著优于 Vim-B 的 81.8%;进一步地,我们首次成功实现大模型规模(即 341M 参数)的扩展,达到 83.6% 的准确率(若使用 384×384 输入微调则达到 84.5%)。此外,针对下游语义分割任务的额外验证也支持 Mamba-R 的有效性。代码已发布于 https://github.com/wangf3014/Mamba-Reg。
引用
@article{arxiv.2405.14857,
title = {Conditional Diffusion on Web-Scale Image Pairs leads to Diverse Image Variations},
author = {Manoj Kumar and Neil Houlsby and Emiel Hoogeboom},
journal= {arXiv preprint arXiv:2405.14857},
year = {2024}
}