放射学基础模型的数据规模定律
计算机视觉与模式识别
2025-09-17 v1 人工智能
摘要
基础视觉编码器,如 CLIP 和 DINOv2,在互联网规模的数据上训练,展现出跨任务和跨数据集的强大迁移性能。然而,医学影像基础模型仍受限于较小的数据集,这限制了我们对数据规模和预训练范式如何影响该场景下性能的理解。在这项工作中,我们系统性地研究了两种视觉编码器——MedImageInsight (MI2) 和 RAD-DINO(分别代表 CLIP 和 DINOv2 这两种主要编码器范式)——在来自单一机构的至多 350 万张胸部 X 光片上的持续预训练,并保持计算资源和评估协议不变。我们在分类(放射学发现、管线与导管)、分割(管线与导管)以及放射学报告生成任务上进行评估。虽然先前的工作主要关注与放射学发现相关的任务,但我们纳入了管线与导管任务以平衡这种偏差,并评估模型提取能够保持细长结构连续性的特征的能力。我们的实验表明,MI2 在与发现相关的任务上扩展更有效,而 RAD-DINO 在与导管相关的任务上更强。令人惊讶的是,使用 UniCL 同时利用报告和结构化标签对 MI2 进行持续预训练能提升性能,这突显了在大规模下结构化监督的价值。我们进一步表明,对于某些任务,少至 3 万个域内样本就足以超越开源权重的基础模型。这些结果凸显了中心特异性持续预训练的实用性,使医疗机构能够通过利用域内数据获得显著的性能提升。
引用
@article{arxiv.2509.12818,
title = {Data Scaling Laws for Radiology Foundation Models},
author = {Maximilian Ilse and Harshita Sharma and Anton Schwaighofer and Sam Bond-Taylor and Fernando Pérez-García and Olesya Melnichenko and Anne-Marie G. Sykes and Kelly K. Horst and Ashish Khandelwal and Maxwell Reynolds and Maria T. Wetscherek and Noel C. F. Codella and Javier Alvarez-Valle and Korfiatis Panagiotis and Valentina Salvatelli},
journal= {arXiv preprint arXiv:2509.12818},
year = {2025}
}