使用混合 CNN-Transformer-集成架构的视网膜眼底多疾病图像分类
计算机视觉与模式识别
2025-03-28 v1 人工智能
机器学习
摘要
我们的研究受到一个紧迫的全球性问题的推动,即大量人口受到视网膜疾病的影响,这些疾病分布均匀但缺乏专业医疗 expertise 的服务,特别是在非城市地区。我们的首要目标是通过开发一个仅从眼底图像就能准确预测视网膜疾病的综合诊断系统来弥合这一医疗差距。然而,由于数据集有限且多样、类别分布不平衡,我们面临着重大挑战。为了克服这些问题,我们设计了创新策略。我们的研究引入了新方法,利用结合了更深层卷积神经网络(CNN)、Transformer 编码器和集成架构的混合模型,以串行和并行方式将视网膜眼底图像分类为 20 个疾病标签。我们的总体目标是评估这些先进模型在实际应用中的潜力,并高度关注在更广泛的疾病范围内提高视网膜疾病诊断的准确性。重要的是,我们的努力超越了基线模型的结果,其中 C-Tran 集成模型表现最佳,取得了 0.9166 的显著模型得分,超过了 0.9 的基线得分。此外,使用 IEViT 模型的实验展示了同样有希望的结果,且计算效率有所提高。我们还证明了动态分块提取和领域知识在计算机视觉任务中集成的有效性。总而言之,我们的研究力求为视网膜疾病诊断做出重大贡献,解决服务欠缺地区对可及医疗解决方案的迫切需求,同时旨在实现全面准确的疾病预测。
引用
@article{arxiv.2503.21465,
title = {Retinal Fundus Multi-Disease Image Classification using Hybrid CNN-Transformer-Ensemble Architectures},
author = {Deependra Singh and Saksham Agarwal and Subhankar Mishra},
journal= {arXiv preprint arXiv:2503.21465},
year = {2025}
}
备注
17 pages, 3 figures, 7 tables. Conference paper presented at the International Health Informatics Conference (IHIC 2023)