中文

从像素到解释:基于CNN-Transformer集成的可解释糖尿病视网膜病变分级

计算机视觉与模式识别 2026-04-28 v1 人工智能

摘要

糖尿病视网膜病变(DR)筛查的质量依赖于正确分级严重程度的能力,但许多深度学习(DL)分类器在临床背景下难以被解释。本研究提出一种方法,将强大的判别模型与多模态解释相结合,将视网膜像素转换为临床可解释的输出。使用APTOS 2019基准,我们在受控的分层五折交叉验证协议下评估了六个代表性的CNN和基于变换器的 backbone。我们随后比较了集成策略(硬投票、加权软投票、堆叠)并探讨了一种混合类别级融合变体以利用分级特定优势。对于可解释性,我们产生了Grad-CAM++可视化归因图并使用以视觉语言模型(VLM)为基金图像和分类器输出条件化的短文本理由,在保守的提示约束下。现代CNN backbone(ResNet-50和ConvNeXt-Tiny)提供了最强的单模型基线,交叉验证QWK分别达到0.919和0.914。集成提高了序数一致性,加权软投票在各折中最为一致(QWK 0.934 +/- 0.017)。混合类别级融合虽具竞争力,但在配对折比较中未显著优于标准融合(Holm调整后 p >= 1.000)。对于解释质量,Grad-CAM++提供了合理但粗糙的局部化,VLM理由通常与分级一致。定量上,VLM变体在临床完整性和模板级别语义相似性之间呈现权衡(覆盖率0.700 vs. BERTScore 0.072),而图像-文本对齐相当(CLIPScore约0.34)。

关键词

引用

@article{arxiv.2604.23079,
  title  = {From Pixels to Explanations: Interpretable Diabetic Retinopathy Grading with CNN-Transformer Ensembles, Visual Explainability and Vision-Language Models},
  author = {Pir Bakhsh Khokhar and Carmine Gravino and Fabio Palomba and Sule Yildirim Yayilgan and Sarang Shaikh},
  journal= {arXiv preprint arXiv:2604.23079},
  year   = {2026}
}