放射学中视觉语言预训练的现实检验:我们是否通过文本取得了进步?
计算机视觉与模式识别
2025-04-08 v1
摘要
视觉语言预训练最近因允许使用大规模数据源学习丰富特征表示而获得了流行。该范式迅速进入了医学图像分析社区。特别是,近期有大量文献开发针对放射学的视觉语言模型。然而,可用带图像-文本监督的医学数据集稀缺,医学概念细粒度且涉及专家知识,现有的视觉语言模型难以编码。本文我们提出一个审慎的步骤,回顾使用细粒度标签的监督、单模态预训练。我们进行广泛比较,表明单模态预训练在整合异构数据源方面具有高度竞争力。我们的结果也质疑了近期视觉语言模型在开放词汇泛化潜力,这些模型使用乐观的实验设置进行评估。最后,我们研究了更好集成细粒度标签和噪声文本监督的新方法。
引用
@article{arxiv.2504.05227,
title = {A Reality Check of Vision-Language Pre-training in Radiology: Have We Progressed Using Text?},
author = {Julio Silva-Rodríguez and Jose Dolz and Ismail Ben Ayed},
journal= {arXiv preprint arXiv:2504.05227},
year = {2025}
}
备注
IPMI 2025. Code and weights: https://github.com/jusiro/DLILP