中文

MambaPanoptic:基于 Vision Mamba 的结构化状态空间框架用于全景分割

计算机视觉与模式识别 2026-05-20 v2

摘要

全景分割需要同时识别可计数的 thing 实例和无定形的 stuff 区域,对长程上下文建模、多尺度特征表示和高效稠密预测提出了联合要求。现有的卷积和变换器方法难以同时满足这三个要求:卷积架构在建模长程依赖方面受限,而变换器方法则在高分辨率下产生二次计算成本。本文提出MambaPanoptic,一个完全基于 Mamba 的全景分割框架,通过两个主要贡献来解决这些限制。首先,我们引入MambaFPN,一个自上而下的特征金字塔,利用 Mamba 块生成具有全局一致性和线性计算复杂度的多尺度特征表示。其次,我们采用 PanopticFCN 风格的核发生器,产生统一的 thing 和 stuff 核,用于无提案的全景预测,并通过应用于多个网络阶段的 QuadMamba 特征细化模块增强。在 Cityscapes 和 COCO 全景分割基准测试上进行的实验表明,MambaPanoptic 在相当的模型规模下, consistently outperform PanopticDeepLab 和 PanopticFCN,在 Cityscapes 上实现与 Mask2Former 相当或更好的 PQ 和 AP,同时所需参数更少。

关键词

引用

@article{arxiv.2605.12640,
  title  = {MambaPanoptic: A Vision Mamba-based Structured State Space Framework for Panoptic Segmentation},
  author = {Qing Cheng and Damiano Bertolini and Wei Zhang and Dong Wang and Niclas Zeller and Daniel Cremers},
  journal= {arXiv preprint arXiv:2605.12640},
  year   = {2026}
}

备注

Accepted to ISPRS Congress 2026, camera-ready version