中文

TEC-Net:视觉 Transformer 结合卷积神经网络用于医学图像分割

图像与视频处理 2023-12-21 v3 计算机视觉与模式识别

摘要

卷积神经网络(CNN)与 Transformer 的混合架构已成为医学图像分割最流行的方法。然而,现有基于混合架构的网络存在两个问题。第一,尽管 CNN 分支可通过卷积操作捕获图像局部特征,但原始卷积无法实现图像特征的自适应提取。第二,尽管 Transformer 分支可建模图像全局信息,传统自注意力仅关注图像的空间自注意力,忽略通道与跨维自注意力,导致对具有复杂背景的医学图像分割精度低。为解决这些问题,我们提出视觉 Transformer 结合卷积神经网络用于医学图像分割(TEC-Net)。我们的网络有两个优势。第一,在 CNN 分支中设计了动态可变形卷积(DDConv),不仅克服了使用固定尺寸卷积核进行自适应特征提取的困难,也解决了不同输入共享相同卷积核参数的缺陷,有效提升 CNN 分支的特征表达能力。第二,在 Transformer 分支中,设计了(偏移)窗口自适应互补注意力模块((S)W-ACAM)与紧凑卷积投影,使网络以极少参数与计算量充分学习医学图像的跨维长程依赖。实验结果表明,所提 TEC-Net 比包括 CNN 与 Transformer 网络在内的 SOTA 方法提供更优的医学图像分割结果。此外,我们的 TEC-Net 需要更少的参数与计算成本,且不依赖预训练。代码公开于 https://github.com/SR0920/TEC-Net。

关键词

引用

@article{arxiv.2306.04086,
  title  = {TEC-Net: Vision Transformer Embrace Convolutional Neural Networks for Medical Image Segmentation},
  author = {Rui Sun and Tao Lei and Weichuan Zhang and Yong Wan and Yong Xia and Asoke K. Nandi},
  journal= {arXiv preprint arXiv:2306.04086},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2306.03373