中文

LeViT-UNet:为医学图像分割构建更快的 Transformer 编码器

计算机视觉与模式识别 2021-07-20 v1

摘要

医学图像分割在开发计算机辅助诊断与治疗系统中起着至关重要的作用,但仍面临诸多挑战。过去几年,基于 CNN 的流行编码器-解码器架构(如 U-Net)已成功应用于医学图像分割任务。然而,由于卷积操作的局部性,它们在学习的全局上下文与长距离空间关系方面表现出局限性。近来,若干研究者尝试将 transformer 引入编码器与解码器组件并取得可喜结果,但因 transformer 的高计算复杂度,其效率仍需进一步提升。本文中,我们提出 LeViT-UNet,将 LeViT Transformer 模块集成入 U-Net 架构,以实现快速且准确的医学图像分割。具体而言,我们使用 LeViT 作为 LeViT-UNet 的编码器,更好地权衡了 Transformer 模块的精度与效率。此外,来自 LeViT 的 transformer 块与卷积块的多尺度特征图通过跳跃连接传入解码器,可有效复用特征图的空间信息。我们的实验表明,在包括 Synapse 与 ACDC 在内的多个具挑战性的医学图像分割基准上,所提 LeViT-UNet 相较于多种竞争方法取得了更优性能。代码与模型将公开于 https://github.com/apple1986/LeViT_UNet。

关键词

引用

@article{arxiv.2107.08623,
  title  = {LeViT-UNet: Make Faster Encoders with Transformer for Medical Image Segmentation},
  author = {Guoping Xu and Xingrong Wu and Xuan Zhang and Xinwei He},
  journal= {arXiv preprint arXiv:2107.08623},
  year   = {2021}
}