中文

利用合成数据进行医学视觉-语言预训练:规避对真实图像的需求

计算机视觉与模式识别 2024-05-01 v2 机器学习

摘要

医学视觉-语言预训练(VLP)从医学图像与配对的放射学报告联合学习表征。它通常需要大规模图文配对数据集,以实现对图像编码器与文本编码器的有效预训练。文本引导生成模型的出现提出了一个引人深思的问题:VLP 能否仅使用由真实放射学报告生成的合成图像来实现,从而减少对大量图文配对与整理的需求?在本工作中,我们通过对使用合成图像进行医学 VLP 的可行性与有效性进行考察,来审视这一问题。我们用从真实医学报告生成的合成等价图像替换真实医学图像。利用三种最先进的 VLP 算法,我们仅在这些合成样本上训练。我们在三个后续任务(即图像分类、语义分割与目标检测)上的实证评估表明,通过合成数据取得的性能与真实图像相当甚至超越。作为该领域的开创性贡献,我们引入了一个大规模合成医学图像数据集,与匿名化的真实放射学报告配对。这缓解了对医学图像共享的需求,而医学图像在实践中不易整理与共享。代码与数据集可在 \href{https://github.com/cheliu-computation/MedSyn-RepLearn/tree/main}{https://github.com/cheliu-computation/MedSyn-RepLearn/tree/main} 找到。

关键词

引用

@article{arxiv.2310.07027,
  title  = {Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images},
  author = {Che Liu and Anand Shah and Wenjia Bai and Rossella Arcucci},
  journal= {arXiv preprint arXiv:2310.07027},
  year   = {2024}
}

备注

Accepted by CVPR 2024 Workshop Data Curation and Augmentation in Enhancing Medical Imaging Applications