Chest-Diffusion:用于报告到胸部X光生成的轻量级文本到图像模型
计算机视觉与模式识别
2024-07-02 v1 人工智能
摘要
文本到图像生成对生成多样且可控图像具有重要意义。虽然已有多种尝试将 Stable Diffusion (SD) 应用于医学领域,但由于医学报告与自然文本之间的大分布差异,以及常见稳定扩散模型的高计算复杂度,限制了生成医学图像的真实性和可行性。为解决上述问题,我们提出了一种 novel 轻量级基于变换器的扩散模型学习框架,名为 Chest-Diffusion,用于报告到胸部X光 (CXR) 的生成。Chest-Diffusion 采用领域特定的文本编码器获取准确且富有表现力的文本特征,以指导图像生成,从而提高生成图像的真实性。同时,我们引入轻量级变换器架构作为去噪模型,降低了扩散模型的计算复杂度。实验表明,我们的 Chest-Diffusion 在计算预算为 118.918 GFLOPs 的情况下,实现了最低的 FID 分数 24.456,计算复杂度约为 SD 的三分之一。
引用
@article{arxiv.2407.00752,
title = {Chest-Diffusion: A Light-Weight Text-to-Image Model for Report-to-CXR Generation},
author = {Peng Huang and Xue Gao and Lihong Huang and Jing Jiao and Xiaokang Li and Yuanyuan Wang and Yi Guo},
journal= {arXiv preprint arXiv:2407.00752},
year = {2024}
}