面向高效 3D 医学图像分割的混合 Mamba-SAM 架构
摘要
对 3D 医学图像(如 MRI 和 CT)的精准分割是临床诊断和治疗规划的关键。Foundation模型如 Segment Anything Model (SAM) 提供了强大的通用表征,但因领域迁移问题、固有的 2D 设计以及微调的高计算成本,在医学影像中表现不佳。为此,我们提出 Mamba-SAM,一种新型且高效的混合架构,将冻结的 SAM 编码器与 Mamba 基于状态空间模型(SSM)的线性时间效率和长程建模能力相结合。我们研究了两种参数高效的适应策略:第一种是双分支架构,通过跨注意力显式融合来自冻结 SAM 编码器的通用特征与由可训练 VMamba 编码器学习的领域特定表征。第二种是基于适配器的方法,将轻量级、3Daware 的 Tri-Plane Mamba(TPMamba)模块注入冻结的 SAM ViT 编码器中,以隐式建模体积上下文。在此框架下,我们引入多频率门控卷积(Multi-Frequency Gated Convolution, MFGC),通过 3D 离散余弦变换和自适应门控 jointly 分析空间与频域信息以增强特征表征。在 ACDC 心脏 MRI 数据集上的广泛实验表明,所提方法有效。双分支 Mamba-SAM-Base 模型在平均 Dice 得分上达到 0.906,与 UNet++(0.907)相当,但在肌肉(Myocardium,0.910)和左心室(Left Ventricle,0.971)分割上均超越所有基线方法。适配器-based TP MFGC 变体在推理速度(4.77 FPS)和强准确性(0.880 Dice)方面表现优异。这些结果表明,混合基础模型与高效 SSM-based 架构为 3D 医学图像分割提供了一种实用且有效的解决方案。
引用
@article{arxiv.2602.00650,
title = {A Hybrid Mamba-SAM Architecture for Efficient 3D Medical Image Segmentation},
author = {Mohammadreza Gholipour Shahraki and Mehdi Rezaeian and Mohammad Ghasemzadeh},
journal= {arXiv preprint arXiv:2602.00650},
year = {2026}
}