RoentGen:用于胸部 X 光生成的视觉-语言基础模型
计算机视觉与模式识别
2022-11-24 v1 人工智能
计算与语言
机器学习
摘要
在大型自然图像-文本对数据集上训练的多模态模型已展现出生成高质量图像的惊人能力。医学影像数据从根本上不同于自然图像,且用于简洁捕捉医学数据相关细节的语言使用了一种不同的、狭窄但语义丰富的领域特定词汇。不足为奇的是,在自然图像-文本对上训练的多模态模型往往不能很好地泛化到医学领域。开发忠实表示医学概念同时提供组合多样性的生成式影像模型,可以缓解当前高质量标注医学影像数据集的匮乏。在这项工作中,我们开发了一种策略,通过在公开可用的胸部 X 光(CXR)及其对应放射学(文本)报告语料上适配预训练的潜在扩散模型,来克服自然-医学间的巨大分布偏移。我们研究了模型根据文本提示生成高保真、多样化合成 CXR 的能力。我们使用图像质量指标定量评估模型输出,并由人类领域专家评价图像质量与文本-图像对齐情况。我们提供的证据表明,所得模型(RoentGen)能够创建视觉上令人信服、多样化的合成 CXR 图像,并且通过使用包含放射学特定语言的自由格式文本提示,输出可在新程度上受控。在固定训练集上微调该模型并将其用作数据增强方法,我们测得在合成与真实图像上联合训练的分类器有 5% 的提升,而在更大但纯合成训练集上训练时有 3% 的提升。最后,我们观察到该微调将领域内知识蒸馏进文本编码器中,并能将其对某些疾病(如气胸)的表示能力提高 25%。
引用
@article{arxiv.2211.12737,
title = {RoentGen: Vision-Language Foundation Model for Chest X-ray Generation},
author = {Pierre Chambon and Christian Bluethgen and Jean-Benoit Delbrouck and Rogier Van der Sluijs and Małgorzata Połacin and Juan Manuel Zambrano Chaves and Tanishq Mathew Abraham and Shivanshu Purohit and Curtis P. Langlotz and Akshay Chaudhari},
journal= {arXiv preprint arXiv:2211.12737},
year = {2022}
}
备注
19 pages