中文

基于双眼和知识蒸馏的视网膜图像白内障可解释深度学习

图像与视频处理 2025-09-30 v1 计算机视觉与模式识别

摘要

白内障是全球视力障碍的主要原因之一,及时从视网膜成像中检测可发挥关键作用。我们提出一种用于白内障分类的深度学习管线,采用包含5000名患者左右眼眼底照片的 Ocular Disease Recognition 数据集。我们评估了 CNN、transformer、轻量级架构和知识蒸馏模型。表现最佳的模型 Swin-Base Transformer 实现了98.58% 的准确率和0.9836 的 F1 分数。经蒸馏的 MobileNetV3 模型达到98.42% 的准确率和0.9787 的 F1 分数,计算成本大幅降低。提出的双眼 Siamese 变体蒸馏 MobileNet,整合双眼信息,实现了98.21% 的准确率。就可解释性而言,Grad-CAM 显示 CNN 集中注意力于医学相关特征,如视网膜浑浊和中心模糊。这些结果表明,即使在轻量级模型下,也可实现准确且可解释的白内障检测,支持在资源受限环境中的临床应用。

关键词

引用

@article{arxiv.2509.22696,
  title  = {Explainable Deep Learning for Cataract Detection in Retinal Images: A Dual-Eye and Knowledge Distillation Approach},
  author = {MohammadReza Abbaszadeh Bavil Soflaei and Karim SamadZamini},
  journal= {arXiv preprint arXiv:2509.22696},
  year   = {2025}
}

备注

13 Pages, 8 figures, Submitted as part of PhD research