中文

BEFUnet:一种用于精确医学图像分割的混合CNN-Transformer架构

计算机视觉与模式识别 2024-02-15 v1

摘要

医学图像的精确分割对于各种医疗保健应用至关重要。卷积神经网络(CNN),特别是像U-Net这样的全卷积网络(FCN),在医学图像分割任务中取得了显著成功。然而,它们在捕捉全局上下文和长距离关系方面存在局限性,尤其是对于形状、尺度和纹理变化显著的物体。虽然Transformer在自然语言处理和图像识别中取得了最先进的结果,但由于图像局部性和平移不变性问题,它们在医学图像分割中面临挑战。为了解决这些挑战,本文提出了一种创新的U形网络,称为BEFUnet,它增强了主体和边缘信息的融合,以实现精确的医学图像分割。BEFUnet包含三个主要模块,包括一个新颖的局部交叉注意力特征(LCAF)融合模块、一个新颖的双层融合(DLF)模块以及一个双分支编码器。该双分支编码器由一个边缘编码器和一个主体编码器组成。边缘编码器采用PDC块进行有效的边缘信息提取,而主体编码器则使用Swin Transformer通过全局注意力捕获语义信息。LCAF模块通过在两种模态之间空间上接近的特征上选择性地执行局部交叉注意力,高效地融合边缘和主体特征。与全局交叉注意力相比,这种局部方法显著降低了计算复杂度,同时确保了精确的特征匹配。在医学图像分割数据集上,BEFUnet在各种评估指标上均表现出优于现有方法的性能。

关键词

引用

@article{arxiv.2402.08793,
  title  = {BEFUnet: A Hybrid CNN-Transformer Architecture for Precise Medical Image Segmentation},
  author = {Omid Nejati Manzari and Javad Mirzapour Kaleybar and Hooman Saadat and Shahin Maleki},
  journal= {arXiv preprint arXiv:2402.08793},
  year   = {2024}
}