S2M-Net:用于医学图像分割的谱-空域混合与形态感知自适应损失
计算机视觉与模式识别
2026-05-11 v2
摘要
医学图像分割需要在局部精度、全局上下文和计算效率之间进行平衡,这是一个现有架构难以解决的三难问题。虽然卷积网络以 的成本提供局部精度,但受限于感受野;而视觉变换器通过 的自注意力实现全局上下文,却在小型临床数据集上导致过拟合。我们提出 S2M-Net,一个参数为 47 万的架构,通过两种协同创新实现 的全局上下文:(i) 谱选择性 Token 混合器 (SSTM),通过截断 2D FFT 结合可学习的频率滤波和内容门控空间投影,利用医学图像的谱浓度,避免二次注意力成本同时保持全局感受野;(ii) 形态感知自适应分割损失 (MASL),自动分析结构特征 (紧凑性、管状性、不规则性、尺度),通过受约束的可学习权重调制五种互补损失组件,消除手动 per-dataset 调参。全面评估在 16 个医学影像数据集上进行,涵盖 8 种模态,显示出业界最先进的性能:在结肠息肉分割上达 96.12% Dice,手术器械上达 83.77%(较 prior art 提升 17.85%),脑肿瘤上达 80.90%,在专业基线上保持 3-18% 的持续性提升,同时使用比变换器方法少 3.5--6 倍的参数。
引用
@article{arxiv.2601.01285,
title = {S2M-Net: Spectral-Spatial Mixing for Medical Image Segmentation with Morphology-Aware Adaptive Loss},
author = {Md. Sanaullah Chowdhury Lameya Sabrin},
journal= {arXiv preprint arXiv:2601.01285},
year = {2026}
}
备注
I would like to withdraw the paper from arXiv because the current version contains issues that need to be carefully revised before public dissemination