中文

基于证据理论桥接 CNN 与 ViT 的混合框架用于糖尿病视网膜病变分级

计算机视觉与模式识别 2025-10-31 v1

摘要

糖尿病视网膜病变(Diabetic Retinopathy, DR)是中老年人群中导致视力丧失的主要原因,对他们的日常生活和心理健康具有显著影响。为提高临床筛查效率并实现早期检测 DR,最近基于卷积神经网络(CNN)或视觉 Transformer(ViT)的自动化 DR 诊断系统不断建立。然而,由于 CNN/ViT 各自的局限性,使用单一 backbone 的现有方法已达到性能瓶颈。进一步提高方法之一是整合不同类型的 backbone,这可以充分发挥两者各自的优势(即 CNN 的局部特征提取能力和 ViT 的全局特征捕获能力)。为此,我们提出一种新颖的范式,通过证据理论有效融合由不同 backbone 提取的特征。具体而言,提出的证据融合范式通过一组深度证据网络将来自不同 backbone 的特征转换为支持证据。有了支持证据,可以相应地形成聚合意见,用于自适应调节不同 backbone 之间的融合模式,从而提升混合模型的性能。我们在两个公开可用的 DR 分级数据集上对方法进行了评估。实验结果表明,我们的混合模型不仅在 DR 分级准确率方面优于当前最先进的框架,而且为特征融合和决策提供了优秀的可解释性。

关键词

引用

@article{arxiv.2510.26315,
  title  = {A Hybrid Framework Bridging CNN and ViT based on Theory of Evidence for Diabetic Retinopathy Grading},
  author = {Junlai Qiu and Yunzhu Chen and Hao Zheng and Yawen Huang and Yuexiang Li},
  journal= {arXiv preprint arXiv:2510.26315},
  year   = {2025}
}