训练仅需数据量为一半且计算资源减少400倍的高性能视网膜基础模型
计算机视觉与模式识别
2024-09-24 v2 人工智能
摘要
人工智能在医学领域传统上受限于缺乏大规模训练数据集。基础模型(Foundation Model)是指可通过小规模数据集适配下游任务的预训练模型,可能缓解这一问题。Moorfields Eye Hospital (MEH) 的研究人员提出了 RETFound-MEH,这是一个在90万张图像上训练的视网膜基础模型,包括私人医院数据。最近提出了数据高效的 DERETFound,只需训练15万张公开图像即可实现相当的性能。然而,这两者都需要大量资源进行初始训练,且在下游使用时也十分耗资源。我们提出了一种新颖的 Token Reconstruction 目标,用于训练 RETFound-Green——这是一个仅使用7.5万张公开图像、计算资源减少400倍的视网膜基础模型。我们估算 RETFound-MEH 和 DERETFound 的训练成本分别为 $10,000 和 $14,000。RETFound-Green 的训练成本不足 $100,且环境影响显著降低。RETFound-Green 在下游任务中也更高效:可下载速度快14倍,向量嵌入计算速度快2.7倍,存储空间需求减少2.6倍。尽管如此,RETFound-Green 的性能并未系统性下降。事实上,在来自巴西、印度和中国的三个下游数据集上进行的各种任务中,它在119项比较中以68项最佳性能,分别超过 DERETFound 的21项和 RETFound-MEH 的13项。我们的结果表明,RETFound-Green 是一个非常高效、高性能的视网膜基础模型。我们预计该 Token Reconstruction 目标可以扩展以获得更高性能,并可应用于视网膜成像之外的其他领域。
引用
@article{arxiv.2405.00117,
title = {Training a high-performance retinal foundation model with half-the-data and 400 times less compute},
author = {Justin Engelmann and Miguel O. Bernabeu},
journal= {arXiv preprint arXiv:2405.00117},
year = {2024}
}