中文

DS-TransUNet:用于医学图像分割的双 Swin Transformer U-Net

计算机视觉与模式识别 2021-06-15 v1

摘要

自动医学图像分割因深度学习的发展而取得了巨大进步。然而,大多数现有方法基于卷积神经网络(CNNs),由于卷积操作中感受野的限制,无法建立长程依赖和全局上下文连接。受 Transformer 在建模长程上下文信息方面成功的启发,一些研究者已付出大量努力设计基于 Transformer 的 U-Net 的鲁棒变体。此外,视觉 Transformer 中使用的图像块划分通常忽略了每个图像块内部的像素级内在结构特征。为缓解这些问题,我们提出了一种称为双 Swin Transformer U-Net(DS-TransUNet)的新型深度医学图像分割框架,这或许是首次尝试将分层 Swin Transformer 的优势同时引入标准 U 形架构的编码器和解码器,以提升不同医学图像的语义分割质量。与许多先前的基于 Transformer 的方案不同,所提出的 DS-TransUNet 首先采用基于 Swin Transformer 的双尺度编码器子网络来提取不同语义尺度的粗粒度和细粒度特征表示。作为我们 DS-TransUNet 的核心组件,提出了一种精心设计的 Transformer 交互融合(TIF)模块,通过自注意力机制有效建立不同尺度特征之间的全局依赖关系。此外,我们还将 Swin Transformer 块引入解码器,以在上采样过程中进一步挖掘长程上下文信息。在四个典型医学图像分割任务上的大量实验证明了 DS-TransUNet 的有效性,并表明我们的方法显著优于最先进的方法。

关键词

引用

@article{arxiv.2106.06716,
  title  = {DS-TransUNet:Dual Swin Transformer U-Net for Medical Image Segmentation},
  author = {Ailiang Lin and Bingzhi Chen and Jiayu Xu and Zheng Zhang and Guangming Lu},
  journal= {arXiv preprint arXiv:2106.06716},
  year   = {2021}
}