中文

将预训练视觉-语言基础模型适配至医学影像领域

计算机视觉与模式识别 2023-01-03 v1 人工智能 计算与语言 机器学习

摘要

多模态基础模型通常在数百万对自然图像和文本描述对上进行训练,这些图像-文本对常通过网页爬取方法获得。尽管此类模型展现出优异的生成能力,但它们通常不能很好地泛化到特定领域,例如与自然图像分布存在根本性偏移的医学图像。构建能够忠实刻画临床语境的医学图像生成模型,有助于缓解医疗数据集的匮乏。因此,在本研究中,我们致力于研究并扩展大型预训练基础模型对医学概念的表征能力,具体而言,利用 Stable Diffusion 模型生成医学影像中的领域特定图像。我们探究了 Stable Diffusion 流程的子组件(变分自编码器、U-Net 和文本编码器),以微调模型来生成医学图像。我们使用定量图像质量指标和由放射科医生驱动的定性评估来基准测试这些工作的有效性,这些评估准确表征了条件文本提示的临床内容。我们表现最佳的模型在 stable diffusion 基线上有所提升,并且可被条件化地在合成放射学图像上插入外观逼真的异常,同时在训练用于检测该异常的分类器上保持 95% 的准确率。

关键词

引用

@article{arxiv.2210.04133,
  title  = {Adapting Pretrained Vision-Language Foundational Models to Medical Imaging Domains},
  author = {Pierre Chambon and Christian Bluethgen and Curtis P. Langlotz and Akshay Chaudhari},
  journal= {arXiv preprint arXiv:2210.04133},
  year   = {2023}
}

备注

17 pages, 8 figures