中文

面向视网膜底图的可解释疾病检测的混合式全卷积CNN-Transformer模型

计算机视觉与模式识别 2025-09-03 v4 人工智能

摘要

在许多医学影像任务中,卷积神经网络(CNN)有效地以层级方式提取局部特征。最近,视觉Transformer(ViT)因使用自注意力机制捕获全局依赖关系而受到欢迎,但缺乏卷积的内在空间局部分析能力。因此,开发结合CNN和ViT的混合模型以发挥两者架构的优势。然而,这类混合模型难以解释,阻碍了其在医学影像中的应用。本文引入一种面向视网膜疾病检测的可解释设计混合全卷积CNN-Transformer架构。不同于广泛使用的ViT后置显著性方法,我们的方法生成直接反映模型决策过程的忠实且局部分析证据图。我们在两个以彩色视网膜底图为核心的医学任务上进行了评估。我们的模型在黑箱模型和可解释模型中实现了领先的预测性能,并在单次前向传播中提供类别特定的稀疏证据图。代码已公开:https://github.com/kdjoumessi/Self-Explainable-CNN-Transformer

关键词

引用

@article{arxiv.2504.08481,
  title  = {A Hybrid Fully Convolutional CNN-Transformer Model for Inherently Interpretable Disease Detection from Retinal Fundus Images},
  author = {Kerol Djoumessi and Samuel Ofosu Mensah and Philipp Berens},
  journal= {arXiv preprint arXiv:2504.08481},
  year   = {2025}
}

备注

Accepted at the Workshop on Interpretability of Machine Intelligence in Medical Image Computing (IMIMIC) at MICCAI 2025 for oral presentation