中文

上下文注意力网络:Transformer 遇见 U-Net

图像与视频处理 2022-04-01 v2 计算机视觉与模式识别 机器学习

摘要

当前,卷积神经网络(CNN)(如 U-Net)已成为事实标准并在医学图像分割中取得巨大成功。然而,作为缺点,基于 CNN 的方法是一把双刃剑,由于卷积操作固有特性导致的有限感受野,它们无法建立长程依赖和全局上下文连接。因此,近期文章利用 Transformer 变体进行医学图像分割任务,因其通过注意力机制捕获长程相关性的先天能力而开辟了巨大机遇。尽管设计可行,大多数同类研究在捕获局部信息方面性能不佳,从而导致边界区域清晰度不足。本文中,我们提出一种上下文注意力网络以解决上述局限。所提方法利用 Transformer 模块的优势来建模长程上下文依赖。同时,它利用 CNN 编码器捕获局部语义信息。此外,引入了目标级表示以建模区域交互图。提取的层次特征随后被送入上下文注意力模块,利用局部信息自适应地重新校准表示空间。然后,它们在考虑 Transformer 模块导出的长程上下文依赖的同时强调信息性区域。我们在几个大规模公开医学图像分割数据集上验证了我们的方法并取得了最先进的性能。我们已在 https://github.com/rezazad68/TMUnet 提供了实现代码。

关键词

引用

@article{arxiv.2203.01932,
  title  = {Contextual Attention Network: Transformer Meets U-Net},
  author = {Reza Azad and Moein Heidari and Yuli Wu and Dorit Merhof},
  journal= {arXiv preprint arXiv:2203.01932},
  year   = {2022}
}