卷积、Transformer、混合和视觉语言模型用于多疾病视网膜筛查的基准测试
计算机视觉与模式识别
2026-05-27 v1 机器学习
摘要
现代深度学习为自动化视网膜筛查提供了强大工具,但尚不清楚不同视觉模型系列在现实的多疾病环境和域偏移下的表现如何。在本工作中,我们使用视网膜眼底多疾病图像数据集(RFMiD),对来自四个模型系列的十二种架构进行了基准测试:卷积神经网络、视觉Transformer、混合CNN-Transformer骨干网络和视觉语言模型。我们评估了两个任务:针对任何视网膜疾病的二元筛查和跨28个疾病类别的多标签分类。使用标准化的训练、校准和评估协议,我们报告了在特异性接近80%的临床相关操作点下的AUC、F1、精确率、召回率和灵敏度。在RFMiD上,所有架构在二元筛查中表现良好,AUC高于84%,但基于注意力的模型表现最佳。SwinTiny以及混合模型CoAtNet0和MaxViTTiny在二元筛查中取得了最强结果,并在多标签设置中提高了宏F1和微F1。视觉语言模型,包括CLIP ViT-B/16和SigLIP-Base384,与CNN基线具有竞争力,但未超越最佳的Transformer和混合骨干网络。在针对可转诊糖尿病视网膜病变的Messidor-2外部验证中,AUC范围从66.8%到84.7%,混合模型和Transformer模型再次表现出强劲性能。这些结果为多疾病视网膜筛查中的模型选择提供了可重复的参考,并指导未来用于临床部署的自动化筛查工具。
引用
@article{arxiv.2605.26283,
title = {Benchmarking Convolutional, Transformer, Hybrid, and Vision Language Models for Multi Disease Retinal Screening},
author = {Durjoy Dey and Aymane Ajbar and Yuhong Yan},
journal= {arXiv preprint arXiv:2605.26283},
year = {2026}
}
备注
12 pages, 3 figures, accepted at ICMHI 2026, 10th International Conference on Medical and Health Informatics, Kyoto, Japan. To appear in ACM Conference Proceedings