TransDeepLab:基于无卷积 Transformer 的 DeepLab v3+ 用于医学图像分割
图像与视频处理
2022-08-02 v1 计算机视觉与模式识别
机器学习
摘要
卷积神经网络(CNNs)多年来一直是多种计算机视觉任务的事实标准。特别是,基于 U 形带跳跃连接模型或带金字塔池化的空洞卷积等开创性架构的深度神经网络,已被定制用于广泛的医学图像分析任务。此类架构的主要优势在于易于提取多样的局部特征。然而,普遍共识是,由于卷积操作受限感受野尺寸的内在属性,CNNs 无法捕获长程依赖与空间关联。作为替代,Transformer 得益于源自自注意力机制的全局信息建模,近期在自然语言处理与计算机视觉中取得了显著性能。尽管如此,先前研究证明局部与全局特征对密集预测中的深度模型都至关重要,例如分割具有不同形状与构型的复杂结构。为此,本文提出 TransDeepLab,一种新颖的类 DeepLab 纯 Transformer 用于医学图像分割。具体而言,我们利用带偏移窗口的分层 Swin-Transformer 扩展 DeepLabv3 并建模空洞空间金字塔池化(ASPP)模块。对相关文献的彻底检索表明,我们是首个用纯 Transformer 模型建模开创性 DeepLab 模型的工作。在多种医学图像分割任务上的大量实验验证,我们的方法优于或与多数融合 Vision Transformer 与基于 CNN 方法的当代工作相当,同时显著降低了模型复杂度。代码与训练模型公开于 https://github.com/rezazad68/transdeeplab
引用
@article{arxiv.2208.00713,
title = {TransDeepLab: Convolution-Free Transformer-based DeepLab v3+ for Medical Image Segmentation},
author = {Reza Azad and Moein Heidari and Moein Shariatnia and Ehsan Khodapanah Aghdam and Sanaz Karimijafarbigloo and Ehsan Adeli and Dorit Merhof},
journal= {arXiv preprint arXiv:2208.00713},
year = {2022}
}