LBMamba:局部双向 Mamba
摘要
Mamba 是一种通过将 recurrence 重构为并行扫描来加速训练的状态空间模型(SSM),最近作为自注意力机制的线性扩展方法而涌现。由于其单向性,Mamba 中的每个状态仅包含其前导状态的信息,对后续状态一无所知。当前基于 Mamba 的计算机视觉方法通常通过增强 Mamba 的全局前向扫描,添加全局后向扫描,形成双向扫描以恢复完整的感受野。然而,这一操作会增加计算负荷,削弱了 Mamba 原有的效率优势。为消除额外的扫描操作,我们引入 LBMamba,这是一种在前向扫描内部嵌入轻量级局部后向扫描的局部双向 SSM 块,并在每个线程寄存器中执行。基于 LBMamba,我们提出 LBVim,一种每两层交替扫描方向以恢复全局感受野且无需额外后向扫描的 backbone。我们在自然图像和全切片图像(WSIs)上对方法进行验证,证明其始终在性能与吞吐量之间提供更佳的权衡。在相同的吞吐量下,LBVim 在 ImageNet-1K 分类数据集上实现 0.8%~1.6% 更高的 top-1 准确率,在 ADE20K 语义分割数据集上实现 0.6%~2.7% 更高的 mIoU,在 COCO 检测数据集上实现 0.9% 更高的 APb 和 1.1% 更高的 APm。我们的方法还使四个 SOTA Mamba 模型(VMamba、LocalVim、PlainMamba 和 Adventurer)的准确率提高 0.5%~3.4%。我们将 LBMamba 集成到 SOTA 病理多实例学习(MIL)模型 MambaMIL 中,该模型是单向的。实验表明,在 3 个公开 WSIs 分类数据集上,我们的方法实现了最高可达 3.06% 更好的 AUC、3.39% 更好的 F1、1.67% 更好的准确率。我们的代码已公开于 https://github.com/cvlab-stonybrook/LBMamba。
引用
@article{arxiv.2506.15976,
title = {LBMamba: Locally Bi-directional Mamba},
author = {Jingwei Zhang and Xi Han and Hong Qin and Mahdi S. Hosseini and Dimitris Samaras},
journal= {arXiv preprint arXiv:2506.15976},
year = {2025}
}
备注
Accepted to TMLR