中文

SegMAN:用于语义分割的状态空间模型与局部注意力的全尺度上下文建模

计算机视觉与模式识别 2025-03-28 v2

摘要

高质量语义分割依赖于三个关键能力:全局上下文建模、局部细节编码和多尺度特征提取。然而,近期方法往往难以同时具备上述所有能力。因此,我们旨在使分割网络能够同时高效地进行全局上下文建模、高质量的局部细节编码以及丰富的多尺度特征表示,以适应不同输入分辨率。本文提出SegMAN,一种线性时间模型,包括称为SegMAN编码器的混合特征编码器和基于状态空间模型的解码器。具体而言,SegMAN编码器通过集成滑动局部注意力与动态状态空间模型,实现了高效的全局上下文建模,同时保留细粒度的局部细节。此外,解码器中的MMSCopE模块增强了多尺度上下文特征提取,并能适应输入分辨率。我们的SegMAN-B编码器在ImageNet-1k上达到85.1%的准确率(相较于VMamba-S提升1.5%,且参数更少)。当配合我们的解码器时,完整的SegMAN-B模型在ADE20K上实现52.6%的mIoU(相较于SegNeXt-L提升1.6%,且计算量降低15%),在Cityscapes上达到83.8%的mIoU(相较于SegFormer-B3提升2.1%,且计算量减半),在COCO-Stuff上比VWFormer-B3提高1.6%的mIoU且计算量更低。我们的代码已公开于https://github.com/yunxiangfu2001/SegMAN。

关键词

引用

@article{arxiv.2412.11890,
  title  = {SegMAN: Omni-scale Context Modeling with State Space Models and Local Attention for Semantic Segmentation},
  author = {Yunxiang Fu and Meng Lou and Yizhou Yu},
  journal= {arXiv preprint arXiv:2412.11890},
  year   = {2025}
}

备注

CVPR 2025