Medical Transformer:用于医学图像分割的门控轴向注意力
计算机视觉与模式识别
2021-07-08 v2
摘要
在过去十年中,深度卷积神经网络被广泛用于医学图像分割,并表现出足够的性能。然而,由于卷积架构固有的归纳偏置,它们缺乏对图像中长程依赖的理解。近期提出的基于 Transformer 的架构利用自注意力机制编码长程依赖并学习极具表达力的表示。这促使我们探索基于 Transformer 的方案,并研究将基于 Transformer 的网络架构用于医学图像分割任务的可行性。大多数现有面向视觉应用的基于 Transformer 的网络架构需要大规模数据集才能妥善训练。然而,与视觉应用的数据集相比,医学影像的数据样本数量相对较少,难以高效训练用于医学应用的 Transformer。为此,我们提出了一种门控轴向注意力(Gated Axial-Attention)模型,通过在自注意力模块中引入额外的控制机制来扩展现有架构。此外,为了在医学图像上有效训练模型,我们提出了一种局部-全局训练策略(LoGo),进一步提升了性能。具体而言,我们在整幅图像和图像块上分别操作以学习全局与局部特征。所提出的 Medical Transformer(MedT)在三个不同的医学图像分割数据集上进行了评估,结果表明其性能优于卷积及其他相关的基于 Transformer 的架构。代码:https://github.com/jeya-maria-jose/Medical-Transformer
引用
@article{arxiv.2102.10662,
title = {Medical Transformer: Gated Axial-Attention for Medical Image Segmentation},
author = {Jeya Maria Jose Valanarasu and Poojan Oza and Ilker Hacihaliloglu and Vishal M. Patel},
journal= {arXiv preprint arXiv:2102.10662},
year = {2021}
}
备注
Accepted at MICCAI 2021