中文

MaxViT-UNet:用于医学图像分割的多轴注意力网络

图像与视频处理 2024-04-01 v5 计算机视觉与模式识别 机器学习

摘要

自卷积神经网络(CNNs)出现以来,在医学图像分析中取得了显著进展。然而,卷积算子的局部性可能限制 CNNs 捕获全局与长程交互的能力。近来,Transformer 因能有效处理全局特征而在计算机视觉领域及医学图像分割中受到关注。自注意力机制的可扩展性问题以及缺乏类 CNN 的归纳偏置可能限制了其应用。因此,结合卷积与自注意力机制优势的混合视觉 Transformer(CNN-Transformer)变得重要。本工作中,我们提出 MaxViT-UNet,一种基于编码器-解码器结构的 UNet 型混合视觉 Transformer(CNN-Transformer)用于医学图像分割。所提出的混合解码器旨在以极低内存与计算开销在每个解码阶段同时利用卷积与自注意力机制。在每个解码阶段引入多轴自注意力,显著增强了目标与背景区域的判别能力,从而提升分割效率。混合解码器中还提出了一个新模块。融合过程首先将通过转置卷积获得的上采样低层解码器特征与来自混合编码器的跳跃连接特征进行整合,随后利用多轴注意力机制对融合特征进行精炼。所提解码器模块被重复多次以逐步分割细胞核区域。在 MoNuSeg18 与 MoNuSAC20 数据集上的实验结果证明了该方法的有效性。

关键词

引用

@article{arxiv.2305.08396,
  title  = {MaxViT-UNet: Multi-Axis Attention for Medical Image Segmentation},
  author = {Abdul Rehman Khan and Asifullah Khan},
  journal= {arXiv preprint arXiv:2305.08396},
  year   = {2024}
}

备注

19 pages, 6 figures, 5 tables