Foundation Ark:通过知识累积与复用实现卓越且鲁棒的性能
计算机视觉与模式识别
2023-10-17 v1
摘要
如今深度学习可提供专家级甚至超专家级的性能,但达到此类性能需要海量标注数据用于训练(例如,谷歌专有的CXR基础模型(CXR-FM)在821,544张标注且大多私有的胸部X光片(CXR)上训练)。医学影像领域存在大量公开数据集,但各自规模小且专家标注异构。我们设想一个强大且鲁棒的基础模型,可通过聚合众多小型公开数据集进行训练。为实现该愿景,我们开发了Ark框架,该框架从各数据集中异构的专家标注里累积并复用知识。作为概念验证,我们通过合并ChestX-ray14、CheXpert、MIMIC-II和VinDr-CXR等多个数据集,分别在335,484和704,363张CXR上训练了两个Ark模型,通过微调、线性探测和性别偏倚分析在涵盖分类与分割的广泛影像任务上评估它们,并展示了我们的Ark相对于SOTA全监督/自监督基线以及谷歌专有CXR-FM的卓越且鲁棒的性能。这一增强性能归因于我们简单却有力的发现:聚合众多公开数据集使患者群体多样化并从不同专家处累积知识,从而在不增加标注成本的情况下取得前所未有的性能。随着所有代码与预训练模型发布于GitHub.com/JLiangLab/Ark,我们希望Ark对开放科学产生重要影响,因为从公开数据集的专家标注中累积与复用知识有可能超越基于异常大数据训练的专有模型性能,激励全球更多研究者共享代码与数据集以构建开放基础模型、加速开放科学,并使医学影像深度学习民主化。
引用
@article{arxiv.2310.09507,
title = {Foundation Ark: Accruing and Reusing Knowledge for Superior and Robust Performance},
author = {DongAo Ma and Jiaxuan Pang and Michael B. Gotway and Jianming Liang},
journal= {arXiv preprint arXiv:2310.09507},
year = {2023}
}
备注
Best Paper Award Runner-Up at Medical Image Computing and Computer Assisted Intervention (MICCAI) 2023