中文

Vision Mamba 中的选择性视觉提示

计算机视觉与模式识别 2024-12-13 v1 人工智能

摘要

预训练的Vision Mamba(Vim)模型因其独特的选择性状态空间模型设计,在计算效率方面在各种计算机视觉任务中表现卓越。为进一步扩展Vim模型适用于多样化下游视觉任务,Vim模型可采用称为视觉提示的高效微调技术进行适配。然而,现有视觉提示方法主要针对基于Vision Transformer(ViT)的模型设计,利用全局注意力机制,忽略了Vim模型独特的顺序token级压缩和传播特性。具体而言,附加到序列前的现有提示token不足以有效激活整个序列中的输入和遗忘门,阻碍了判别性信息的提取与传播。为此,本文提出一种新颖的选择性视觉提示(SVP)方法,专为Vim模型的高效微调而设计。为防止状态空间传播期间判别性信息的丢失,SVP采用轻量级选择性提示器进行token级提示生成,确保更新和遗忘门在Mamba模块中的自适应激活,以促进判别性信息的传播。此外,考虑到Vim模型传播了跨层共享信息和特定内部层信息,本文进一步对SVP进行改进,采用双路径结构:Cross-Prompting与Inner-Prompting。Cross-Prompting利用跨层共享参数,而Inner-Prompting采用独立参数,分别促进共享信息和特定信息的传播。广泛的实验结果表明,所提出的SVP显著优于最先进的方法。我们的代码已公开于 https://github.com/zhoujiahuan1991/AAAI2025-SVP

关键词

引用

@article{arxiv.2412.08947,
  title  = {Selective Visual Prompting in Vision Mamba},
  author = {Yifeng Yao and Zichen Liu and Zhenyu Cui and Yuxin Peng and Jiahuan Zhou},
  journal= {arXiv preprint arXiv:2412.08947},
  year   = {2024}
}

备注

in Proceedings of the 39th AAAI Conference on Artificial Intelligence (AAAI-25)