MSLAU-Net:一种用于医学图像分割的混合 CNN-Transformer 网络
计算机视觉与模式识别
2026-04-23 v2
摘要
准确的医学图像分割允许对解剖结构和病理区域进行精确描绘,这对于治疗规划、手术导航和疾病监测至关重要。虽然 CNN 基于和 Transformer 基于的方法在医学图像分割任务中均取得了显著成功,但 CNN 基于的方法因卷积操作的固有局限性,难以有效捕获全局上下文信息。而 Transformer 基于的方法则存在局部特征建模不足的问题,并因自注意力机制导致计算复杂度高。在针对这些局限性提出的解决方案后,我们提出了一种新型的混合 CNN-Transformer 架构,命名为 MSLAU-Net,它整合了两种范式的优势。 proposed MSLAU-Net 包含两个关键思想:首先,它引入多尺度线性注意力(Multi-Scale Linear Attention),旨在以低计算复杂度高效提取医学图像的多尺度特征并建模长程依赖;其次,它采用自上而下的特征聚合机制,通过轻量化结构实现多层次特征聚合并恢复空间分辨率。在覆盖三种成像模态的基准数据集上进行的大量实验表明,所提出的 MSLAU-Net 在 nearly all 评估指标上均优于其他最先进的方法,验证了我们方法的优越性、有效性和鲁棒性。我们的代码已公开于 https://github.com/Monsoon49/MSLAU-Net。
关键词
引用
@article{arxiv.2505.18823,
title = {MSLAU-Net: A Hybrid CNN-Transformer Network for Medical Image Segmentation},
author = {Libin Lan and Yanxin Li and Xiaojuan Liu and Juan Zhou and Jianxun Zhang and Nannan Huang and Yudong Zhang},
journal= {arXiv preprint arXiv:2505.18823},
year = {2026}
}
备注
15 pages, 7 figures, 9 tables