中文

U-Netmer:U-Net 与 Transformer 融合的医学图像分割网络

图像与视频处理 2023-04-05 v1 计算机视觉与模式识别

摘要

基于 U-Net 的深度学习模型与 Transformer 的结合是医学图像分割的新趋势。U-Net 可提取细致的局部语义与纹理信息,而 Transformer 能学习输入图像中像素间的长距离依赖。然而,直接将 Transformer 用于分割存在“token-flatten”问题(将局部块展平为一维 token,丢失局部块内像素间的交互)与“scale-sensitivity”问题(使用固定尺度将输入图像分割为局部块)。相较于直接组合 U-Net 与 Transformer,我们提出一种 U-Net 与 Transformer 的全局-局部方式新组合,称为 U-Netmer,以解决这两个问题。所提 U-Netmer 将输入图像分割为局部块。局部块间的全局上下文信息由 Transformer 的自注意力机制学习,而 U-Net 对每个局部块进行分割而非展平为 token,从而解决“token-flatten”问题。U-Netmer 可使用相同结构与同一参数以不同块大小分割输入图像。因此,U-Netmer 可用不同块大小训练以解决“scale-sensitivity”问题。我们在 7 个公开数据集上针对 7 个器官(脑、心脏、乳腺、肺、息肉、胰腺和前列腺)与 4 种成像模态(MRI、CT、超声和内窥镜)进行了大量实验,表明所提 U-Netmer 可普遍应用于提升医学图像分割精度。这些实验结果显示,与基线及其他模型相比,U-Netmer 提供了最先进的性能。此外,不同尺度下 U-Netmer 输出间的不一致性与分割精度呈线性相关,可作为置信度分数,在无真值情况下按难度对测试图像排序。

关键词

引用

@article{arxiv.2304.01401,
  title  = {U-Netmer: U-Net meets Transformer for medical image segmentation},
  author = {Sheng He and Rina Bao and P. Ellen Grant and Yangming Ou},
  journal= {arXiv preprint arXiv:2304.01401},
  year   = {2023}
}

备注

10 pages, 5 figures, under review