中文

系统性集成注意力模块以实现准确和通用的医学图像诊断

计算机视觉与模式识别 2025-09-09 v1

摘要

深度学习已成为医学图像分析的强大工具;然而,常规卷积神经网络(CNN)常常无法捕获准确诊断所必需的细粒度和复杂特征。为解决这一局限性,我们系统性地将注意力机制集成到五种广泛采用的 CNN 架构中,包括 VGG16、ResNet18、InceptionV3、DenseNet121 和 EfficientNetB5,以增强其聚焦于显著区域的能力并提高判别性能。具体而言,每个基线模型均增添 either Squeeze and Excitation 模块或混合卷积块注意力模块,允许对通道和空间特征表示进行自适应 recalibration。所提出的模型在两个不同的医学影像数据集上进行评估,一个包括多种肿瘤亚型的脑肿瘤 MRI 数据集,另一个包含四类组织类别的 Products of Conception 组织病理数据集。实验结果表明,注意力增强的 CNN 在所有指标上均优于基线架构。特别是,搭载混合注意力的 EfficientNetB5 实现了最高的整体性能,两数据集上均取得显著提升。除了提高分类准确率外,注意力机制还增强了特征局部分辨,导致在异构影像模态上实现更好的泛化。本工作构建了一个系统化的比较框架,用于在多样化的 CNN 架构中嵌入注意力模块,并严格评估了其在多种医学影像任务中的影响。这些发现为开发稳健、可解释且临床可应用的深度学习决策支持系统提供了实用见解。

关键词

引用

@article{arxiv.2509.05343,
  title  = {Systematic Integration of Attention Modules into CNNs for Accurate and Generalizable Medical Image Diagnosis},
  author = {Zahid Ullah and Minki Hong and Tahir Mahmood and Jihie Kim},
  journal= {arXiv preprint arXiv:2509.05343},
  year   = {2025}
}