中文

面向医学图像分割优化视觉 Transformer

计算机视觉与模式识别 2023-06-06 v2

摘要

对于医学图像语义分割(MISS),视觉 Transformer 因具有捕捉长程相关性的固有能力,已成为卷积神经网络的有力替代。然而,现有研究使用的现成视觉 Transformer 模块基于线性投影与特征处理,缺乏细化器官边界的空间与局部上下文。此外,由于归纳偏置有限,Transformer 在小型医学成像数据集上泛化不佳,且依赖大规模预训练。为解决这些问题,我们展示了一种紧凑且精确的 MISS Transformer 网络 CS-Unet 的设计,其在多阶段设计中引入卷积以分层增强 Transformer 的空间与局部建模能力。这主要通过我们精心设计的卷积 Swin Transformer(CST)模块实现,该模块将卷积与多头自注意力及前馈网络融合,以提供固有的局部化空间上下文与归纳偏置。实验表明,未经预训练的 CS-Unet 在以更少参数在多器官与心脏数据集上大幅优于其他对比方法,并取得了最先进的性能。我们的代码已在 Github 上提供。

关键词

引用

@article{arxiv.2210.08066,
  title  = {Optimizing Vision Transformers for Medical Image Segmentation},
  author = {Qianying Liu and Chaitanya Kaul and Jun Wang and Christos Anagnostopoulos and Roderick Murray-Smith and Fani Deligianni},
  journal= {arXiv preprint arXiv:2210.08066},
  year   = {2023}
}