中文

UTNet:一种用于医学图像分割的混合 Transformer 架构

计算机视觉与模式识别 2021-09-29 v2

摘要

Transformer 架构已在若干自然语言处理任务中被证明是成功的。然而,其在医学视觉中的应用在很大程度上仍未被探索。在本研究中,我们提出 UTNet,一种简单而强大的混合 Transformer 架构,它将自注意力整合进卷积神经网络以增强医学图像分割。UTNet 在编码器和解码器中均应用自注意力模块,以最小开销在不同尺度上捕获长程依赖。为此,我们提出了一种高效的自注意力机制及相对位置编码,将自注意力运算的复杂度从 O(n2)O(n^2) 显著降低至近似 O(n)O(n)。我们还提出了一种新的自注意力解码器,以从编码器中的跳跃连接恢复细粒度细节。我们的方法解决了 Transformer 需要海量数据来学习视觉归纳偏置的困境。我们的混合层设计允许将 Transformer 初始化进卷积网络而无需预训练。我们在多标签、多厂商心脏磁共振成像队列上评估了 UTNet。UTNet 展现出优于最先进方法的分割性能与鲁棒性,并有望良好泛化至其他医学图像分割任务。

关键词

引用

@article{arxiv.2107.00781,
  title  = {UTNet: A Hybrid Transformer Architecture for Medical Image Segmentation},
  author = {Yunhe Gao and Mu Zhou and Dimitris Metaxas},
  journal= {arXiv preprint arXiv:2107.00781},
  year   = {2021}
}

备注

Accepted by MICCAI 2021. Code: https://github.com/yhygao/UTNet