中文

DIAMANT:用于医学图像分割的双图像-注意力图编码器

计算机视觉与模式识别 2023-05-01 v1 人工智能

摘要

尽管纯基于 transformer 的架构在许多计算机视觉任务中展现出有前景的性能,但许多由 CNN 和 transformer 模块组成的混合模型被引入以适配更专门化的任务。然而,尽管纯和混合基于 transformer 的架构相比 CNN 在医学图像分割中取得了性能提升,其高昂的训练成本与复杂性使得在真实场景中应用它们具有挑战性。在本工作中,我们提出基于纯卷积层的简单架构,并表明仅利用自监督预训练视觉 transformer 网络(如 DINO)获得的注意力图可视化,就能以低得多的计算成本超越复杂的基于 transformer 的网络。所提架构由两个编码器分支组成,一个分支以原始图像作为输入,另一个分支以来自预训练 DINO 模型的同一图像的多自注意力头注意力图可视化(作为多通道)作为输入。我们在两个公开可用医学成像数据集上的实验结果表明,所提流水线优于 U-Net 和当前最先进的医学图像分割模型。

关键词

引用

@article{arxiv.2304.14571,
  title  = {DIAMANT: Dual Image-Attention Map Encoders For Medical Image Segmentation},
  author = {Yousef Yeganeh and Azade Farshad and Peter Weinberger and Seyed-Ahmad Ahmadi and Ehsan Adeli and Nassir Navab},
  journal= {arXiv preprint arXiv:2304.14571},
  year   = {2023}
}