超越激进扩张的CXR基础模型:数据与计算效率
计算机视觉与模式识别
2026-02-27 v1
摘要
医学影像的基础模型通常在日益增大的数据集上进行预训练,遵循“随时随地扩张”范式。然而,这一策略面临两个关键挑战:大规模医学数据集常常包含 substantial 冗余和严重的类别不平衡,这会导致表示学习偏向于过度代表的模式;而对数据质量异质性无差别的训练则造成计算效率的严重浪费。我们演示了在预训练期间进行主动、原则化的数据策划,作为蛮力数据集扩张的可行且成本效益高的替代方案。我们引入CheXficient,一个胸腔X光(CXR)基础模型,通过有选择地优先选择信息丰富的训练样本来实现目标。CheXficient仅使用1,235,004对CXR图像中22.7%的数据,同时消耗总计算预算的27.3%,却实现了与其完整数据对应的相当或更好的性能,并优于其他大规模预训练模型。我们在覆盖20个独立基准的评估中进行了测试,这些基准涵盖5种任务类型,包括非适应性的即插即用评估(零样图发现分类和跨模态检索)以及适应性下游任务(疾病预测、语义分割和放射学报告生成)。进一步分析表明,CheXficient系统性地优先选择 underrepresented 训练样本,提高了在长尾或罕见疾病上的泛化能力。总体而言,我们的工作为医学视觉-语言基础模型的高效预训练及其下游适应提供了实用见解。
引用
@article{arxiv.2602.22843,
title = {A data- and compute-efficient chest X-ray foundation model beyond aggressive scaling},
author = {Chong Wang and Yabin Zhang and Yunhe Gao and Maya Varma and Clemence Mottez and Faidra Patsatzi and Jiaming Liu and Jin Long and Jean-Benoit Delbrouck and Sergios Gatidis and Akshay S. Chaudhari and Curtis P. Langlotz},
journal= {arXiv preprint arXiv:2602.22843},
year = {2026}
}