低成本医学扩散:用于医学图像生成的文本反转
计算机视觉与模式识别
2024-09-12 v2 图像与视频处理
摘要
用于文本到图像生成的扩散模型以其高效、易用和质量优异而广受欢迎。尽管在消费级GPU上对这些系统进行推理日益可行,但从头训练需要大规模带标注数据集和大量计算资源。在医学图像生成中,由于法律与伦理问题,具有文本报告的大规模公开可用数据集十分有限,这带来了挑战。本工作表明,通过使用文本反转(Textual Inversion)训练文本嵌入,将预训练的Stable Diffusion模型适配到医学成像模态是可实现的。在本研究中,我们使用小型医学数据集(三种模态各100个样本)进行实验,并在数小时内训练生成经专家放射科医生判定为诊断准确的图像。关于文本反转训练与推理参数的实验揭示了在医学领域需要更大的嵌入和更多样本的必要性。分类实验显示,在MRI上检测前列腺癌的诊断准确率(AUC)从0.78提升至0.80。进一步实验通过疾病插值、病理组合以及用于精确疾病外观控制的修复(inpainting)展示了嵌入的灵活性。所训练的嵌入紧凑(小于1 MB),便于数据共享并降低隐私顾虑。
引用
@article{arxiv.2303.13430,
title = {Medical diffusion on a budget: Textual Inversion for medical image generation},
author = {Bram de Wilde and Anindo Saha and Maarten de Rooij and Henkjan Huisman and Geert Litjens},
journal= {arXiv preprint arXiv:2303.13430},
year = {2024}
}
备注
Accepted for publication at MIDL 2024