中文

用于医学图像分割的金字塔医学Transformer

计算机视觉与模式识别 2022-05-02 v3

摘要

深度神经网络一直是医学图像处理领域的主流技术。然而,最流行的基于卷积神经网络(CNN)的医学图像分割方法并不完善,因为它们通过堆叠层或扩大滤波器来建模长程依赖。Transformer与自注意力机制近来被提出,通过建模所有词对词的注意力(无论其位置如何)来有效学习长程依赖。该思想也已扩展到计算机视觉领域,通过创建并将图像块视为嵌入。考虑到整幅图像自注意力的计算复杂度,当前基于Transformer的模型采用固定的划分方案,可能丢失有信息量的关联。此外,当前的医学Transformer在全分辨率图像上建模全局上下文,导致不必要的计算开销。为解决这些问题,我们提出了一种利用金字塔网络架构整合多尺度注意力与CNN特征提取的新方法,即金字塔医学Transformer(PMTrans)。PMTrans通过在多分辨率图像上工作来捕获多范围关联。我们实现了一种自适应划分方案,以保留有信息量的关联并高效访问不同感受野。在三个医学图像数据集(腺体分割、MoNuSeg和HECKTOR数据集)上的实验结果表明,PMTrans在医学图像分割上优于最新的基于CNN和基于Transformer的模型。

关键词

引用

@article{arxiv.2104.14702,
  title  = {Pyramid Medical Transformer for Medical Image Segmentation},
  author = {Zhuangzhuang Zhang and Weixiong Zhang},
  journal= {arXiv preprint arXiv:2104.14702},
  year   = {2022}
}

备注

15 pages, 6 figures