Diff-CXR:基于疾病知识增强扩散模型的 CXR 生成
摘要
文本到图像(Text-To-Image, TTI)生成对于实现受控和多样化的图像生成具有重要意义,具有广泛的潜在应用前景。尽管当前医学 TTI 方法在 report-to-Chest-Xray(CXR)生成方面取得了一些进展,但其生成性能可能受医学数据固有特征的限制。本文提出了一种 novel 的 disease-knowledge enhanced Diffusion-based TTI 学习框架,命名为 Diff-CXR,用于医学报告到 CXR 生成。首先,为最小化噪声数据对生成的负面影响,我们设计了 Latent Noise Filtering Strategy,在潜在空间中逐步学习异常模式的一般特征并予以移除。然后,设计了 Adaptive Vision-Aware Textual Learning Strategy,在特定领域的 Vision-Language Model 中学习简洁且重要的报告嵌入,为 CXR 生成提供文本指导。最后,通过一种精巧的 control adapter 将一般疾病知识整合到预训练的 TTI 模型中,引入疾病知识增强扩散模型,以实现真实且精确的 report-to-CXR 生成。实验表明,Diff-CXR 在 MIMIC-CXR 和 IU-Xray 上的 FID 和 mAUC 分数分别优于最新 SOTA 方法 33.4%/8.0% 和 23.8%/56.4%,且计算复杂度最低仅为 29.641 GFLOPs。下游实验在三个胸部疾病分类基准和一个 CXR-report 生成基准上均表明 Diff-CXR 在改进经典 CXR 分析方法方面有效。值得注意的是,在 1% 真实数据和合成数据组合上训练的模型,可实现与全部数据训练模型相当的竞争 mAUC 分数,展现出巨大的临床应用前景。
引用
@article{arxiv.2410.20165,
title = {Diff-CXR: Report-to-CXR generation through a disease-knowledge enhanced diffusion model},
author = {Peng Huang and Bowen Guo and Shuyu Liang and Junhu Fu and Yuanyuan Wang and Yi Guo},
journal= {arXiv preprint arXiv:2410.20165},
year = {2024}
}