vGamba:用于视觉识别中高效捕获长程依赖的注意力状态空间瓶颈
计算机视觉与模式识别
2026-03-31 v3
摘要
高效捕获长程依赖(Long-range Dependencies, LRD)是视觉识别中的核心挑战,状态空间模型(State-space Models, SSMs)最近作为替代自注意力机制的有前景的方案。然而,将SSMs适配到CNN-based瓶颈中仍具有挑战性,因为现有方法需要复杂的预处理和每个块中多个SSM副本的限制,限制了其实际应用性。我们提出了vGamba,一种混合视觉骨干网络,用单个轻量级SSM模块(Gamba单元)替换标准瓶颈卷积,Gamba单元集成了2D位置感知和注意力空间上下文(Attentive Spatial Context, ASC)模块,用于高效的LRD建模。在多样化的下游视觉任务上进行测试,结果表明vGamba在准确率上与VMamba和ViM等基于SSM的模型保持竞争力,同时在计算和内存效率方面显著优于Bottleneck Transformer(BotNet)。例如,在2048×2048分辨率下,vGamba比BotNet快2.07倍,峰值GPU内存减少93.8%(1.03GB vs. 16.78GB),在分辨率规模化方面类似ResNet-50。这些结果表明,Gamba瓶颈有效克服了BotNet全局建模的内存和计算约束,成为高分辨率视觉任务中实用且可扩展的骨干网络。
引用
@article{arxiv.2503.21262,
title = {vGamba: Attentive State Space Bottleneck for efficient Long-range Dependencies in Visual Recognition},
author = {Yunusa Haruna and Adamu Lawan and Shamsuddeen Hassan Muhammad and Jiaquan Zhang and Chaoning Zhang},
journal= {arXiv preprint arXiv:2503.21262},
year = {2026}
}