中文

S2M-Net:用于医学图像分割的谱-空域混合与形态感知自适应损失

计算机视觉与模式识别 2026-05-11 v2

摘要

医学图像分割需要在局部精度、全局上下文和计算效率之间进行平衡,这是一个现有架构难以解决的三难问题。虽然卷积网络以 O(n)\mathcal{O}(n) 的成本提供局部精度,但受限于感受野;而视觉变换器通过 O(n2)\mathcal{O}(n^2) 的自注意力实现全局上下文,却在小型临床数据集上导致过拟合。我们提出 S2M-Net,一个参数为 47 万的架构,通过两种协同创新实现 O(HWlogHW)\mathcal{O}(HW \log HW) 的全局上下文:(i) 谱选择性 Token 混合器 (SSTM),通过截断 2D FFT 结合可学习的频率滤波和内容门控空间投影,利用医学图像的谱浓度,避免二次注意力成本同时保持全局感受野;(ii) 形态感知自适应分割损失 (MASL),自动分析结构特征 (紧凑性、管状性、不规则性、尺度),通过受约束的可学习权重调制五种互补损失组件,消除手动 per-dataset 调参。全面评估在 16 个医学影像数据集上进行,涵盖 8 种模态,显示出业界最先进的性能:在结肠息肉分割上达 96.12% Dice,手术器械上达 83.77%(较 prior art 提升 17.85%),脑肿瘤上达 80.90%,在专业基线上保持 3-18% 的持续性提升,同时使用比变换器方法少 3.5--6 倍的参数。

关键词

引用

@article{arxiv.2601.01285,
  title  = {S2M-Net: Spectral-Spatial Mixing for Medical Image Segmentation with Morphology-Aware Adaptive Loss},
  author = {Md. Sanaullah Chowdhury Lameya Sabrin},
  journal= {arXiv preprint arXiv:2601.01285},
  year   = {2026}
}

备注

I would like to withdraw the paper from arXiv because the current version contains issues that need to be carefully revised before public dissemination