纯合人工合成数据是否足以支撑医学视觉语言预训练?
计算机视觉与模式识别
2025-02-26 v2 人工智能
摘要
医学视觉语言预训练(MedVLP)已取得显著进展,使其能够为医学图像理解提供零样本任务。然而,通常需要大规模的配对高质量图像文本数据,而医学领域的数据稀缺。近期大型语言模型(LLM)和扩散模型的发展,使得生成大规模合成图像文本对成为可能。这引出了一个问题:“仅凭合成数据,MedVLP能否成功?”为回答此问,我们使用现成的生成模型创建合成放射科报告和配对胸部X光(CXR)图像,提出自动化管道构建多样性高质量的合成数据集,进行严格的研究,从数据视角完全隔离模型和训练设置。我们的结果表明,仅在合成数据上训练的MedVLP模型在零样本分类中平均AUC优于实质数据的模型3.8%。此外,结合合成和真实数据可进一步提高9.07%。此外,在零样本定位、微调分类和分割任务中,基于合成或混合数据训练的MedVLP模型持续优于基于真实数据的模型。我们的分析表明,经过精心设计的合成数据训练的MedVLP模型可能优于训练在真实数据集上的模型,而后者可能受低质量样本和长尾分布的限制。
引用
@article{arxiv.2410.13523,
title = {Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?},
author = {Che Liu and Zhongwei Wan and Haozhe Wang and Yinda Chen and Talha Qaiser and Chen Jin and Fariba Yousefi and Nikolay Burlutskiy and Rossella Arcucci},
journal= {arXiv preprint arXiv:2410.13523},
year = {2025}
}
备注
Under Review