眼科基础模型在临床显著性老年性黄斑变性检测中的基准测试
图像与视频处理
2025-05-23 v2 人工智能
计算机视觉与模式识别
组织与器官
摘要
自监督学习(SSL)使视觉Transformer(ViT)能够从大规模自然图像数据集中学习鲁棒表示,从而增强其跨域泛化能力。在视网膜成像领域,基于自然数据或眼科数据预训练的基础模型已展现出潜力,但领域内预训练的优势仍不确定。为研究这一问题,我们对六种SSL预训练的ViT在七个数字眼底图像(DFI)数据集(共70,000张专家标注图像)上的中度至晚期年龄相关性黄斑变性(AMD)识别任务进行了基准测试。结果表明,在自然图像上预训练的iBOT取得了最高的分布外泛化能力 AUROC为0.80–0.97,优于领域特定模型(AUROC为0.78–0.96)和无预训练的基线ViT-L(AUROC为0.68–0.91)。这些发现凸显了基础模型在提升AMD识别中的价值,并挑战了领域内预训练必要的假设。此外,我们发布了BRAMD,一个来自巴西的开放访问DFI数据集(n=587),包含AMD标签。
引用
@article{arxiv.2505.05291,
title = {Benchmarking Ophthalmology Foundation Models for Clinically Significant Age Macular Degeneration Detection},
author = {Benjamin A. Cohen and Jonathan Fhima and Meishar Meisel and Baskin Meital and Luis Filipe Nakayama and Eran Berkowitz and Joachim A. Behar},
journal= {arXiv preprint arXiv:2505.05291},
year = {2025}
}
备注
10 pages, 3 figures