眼科疾病与眼学:通用型与专用型视觉基础模型比较
图像与视频处理
2025-09-04 v1 计算机视觉与模式识别
摘要
医学基础模型通过大规模临床数据进行预训练,在多样化的临床相关应用中显示出强大的性能。RETFound 在近一百万眼底图像上训练,体现了这一方法在眼底图像应用中的典型。然而,DINOv2 和 DINOv3 等日益强大且规模数倍扩大的通用型基础模型的出现,引发了是否存在必要的领域特定预训练,以及是否存在差距的疑问。为此,我们系统评估了 DINOv2 和 DINOv3 在眼底图像应用中的可适应性,与两个专用 RETFound 模型(RETFound-MAE 和 RETFound-DINOv2)进行比较。我们评估了在眼科疾病检测和全身疾病预测中的性能,使用两种适应策略:微调和线性探针。进一步分析了数据效率和适应效率,以刻画预测性能与计算成本之间的权衡。我们的结果表明,尽管规模化的通用模型在 diverse 任务上具有强大的可适应性,但 RETFound-DINOv2 在眼科疾病检测和眼学任务中始终优于这些通用基础模型,表现出更强的通用性和数据效率。这些发现表明,针对临床应用的专用眼底基础模型仍是最有效的选择,而与通用基础模型差距的缩小表明,持续的数据和模型规模化可以实现领域相关的收益,并将其定位为未来医学基础模型的强大基础。
引用
@article{arxiv.2509.03421,
title = {Generalist versus Specialist Vision Foundation Models for Ocular Disease and Oculomics},
author = {Yukun Zhou and Paul Nderitu and Jocelyn Hui Lin Goh and Justin Engelmann and Siegfried K. Wagner and Anran Ran and Hongyang Jiang and Lie Ju and Ke Zou and Sahana Srinivasan and Hyunmin Kim and Takahiro Ninomiya and Zheyuan Wang and Gabriel Dawei Yang and Eden Ruffell and Dominic Williamson and Rui Santos and Gabor Mark Somfai and Carol Y. Cheung and Tien Yin Wong and Daniel C. Alexander and Yih Chung Tham and Pearse A. Keane},
journal= {arXiv preprint arXiv:2509.03421},
year = {2025}
}
备注
39 pages, 8 Figures