面向多样化文本引导医学图像合成的通用模型
计算机视觉与模式识别
2026-04-22 v7 人工智能
计算与语言
机器学习
摘要
深度学习算法需要大量数据才能实现稳健性能。然而,由于患者隐私问题,医学领域的数据可用性通常受到限制。合成数据为这些挑战提供了可能的解决方案。图像生成模型在医学应用中的使用越来越多,但通常是任务特定的,从而限制了其可扩展性。此外,现有模型通常依赖私有数据集进行训练,这限制了其可重复性。为了解决这些问题,我们引入了MediSyn:一个开放获取、通用、文本引导的潜在扩散模型,能够生成涵盖6个医学专业和10种成像模态的合成图像,同时仅使用公开可用数据进行训练。通过大量实验,我们提供了几个关键贡献。首先,我们证明在视觉多样的医学图像上训练生成模型不会降低合成图像质量。其次,我们表明这种通用方法在计算效率上远高于一组协调的任务特定模型。第三,我们确定通用模型可以生成在视觉和医学上不同模态之间逼真、文本对齐的合成图像,经专家医师验证。第四,我们提供经验证据表明这些合成图像在视觉上与其对应的真实患者图像不同,缓解了对图像生成模型中数据记忆的担忧。最后,我们证明通用模型可以生成合成图像,在数据有限的情况下提高多个医学专业的分类器性能。总之,我们的发现突显了通用图像生成模型在加速医学算法研究和开发方面的巨大潜力。
引用
@article{arxiv.2405.09806,
title = {A Generalist Model for Diverse Text-Guided Medical Image Synthesis},
author = {Joseph Cho and Mrudang Mathur and Cyril Zakka and Dhamanpreet Kaur and Matthew Leipzig and Alex Dalal and Aravind Krishnan and Eubee Koo and Karen Wai and Cindy S. Zhao and Akshay Chaudhari and Matthew Duda and Ashley Choi and Ehsan Rahimy and Lyna Azzouz and Robyn Fong and Rohan Shad and William Hiesinger},
journal= {arXiv preprint arXiv:2405.09806},
year = {2026}
}