中文

SegMaFormer:一种用于高效分割的混合状态空间和Transformer模型

计算机视觉与模式识别 2026-03-24 v1 人工智能

摘要

Transformer和Mamba-based架构的出现显著推进了3D医学图像分割,使其能够实现全局语境建模,这一能力传统上受限于卷积神经网络(CNN)。然而,当前最先进的Transformer模型往往涉及 substantial 计算复杂度和参数数量,这在体积数据上尤其受限,进一步恶化了标注医学成像数据稀缺的局面。为此,本工作引入SegMaFormer,一种轻量级混合架构,将Mamba和Transformer模块整合到分层体积编码器中,以实现高效的长程依赖建模。该模型战略性地在早期高分辨率阶段采用Mamba-based层以降低计算开销,同时捕获essential 空间上下文;而在后期低分辨率阶段保留自注意力机制以细化特征表示。该设计增强了广义旋转位置嵌入以提高空间感知能力。尽管其结构紧凑,SegMaFormer在三个公共基准(Synapse, BraTS, 和 ACDC)上实现了与显著更大模型相当的Dice系数。经验上,我们的方法在参数上减少最高可达75倍,并且显著降低当前最先进模型的FLOPs,为3D医学图像分割建立了一个高效且高性能的解决方案。

关键词

引用

@article{arxiv.2603.22002,
  title  = {SegMaFormer: A Hybrid State-Space and Transformer Model for Efficient Segmentation},
  author = {Duy D. Nguyen and Phat T. Tran-Truong},
  journal= {arXiv preprint arXiv:2603.22002},
  year   = {2026}
}