中文

利用基于策略的强化学习推进文本驱动的胸部X光生成

计算机视觉与模式识别 2024-03-12 v1

摘要

文本条件图像生成扩散模型的最新进展开始为现代医疗领域开辟新机遇,特别是从诊断报告生成胸部X光(CXR)。然而,为了进一步驱动扩散模型生成能够真实反映真实数据复杂性和多样性的CXR,显然需要一种非平凡的学习方法。鉴于此,我们提出了CXRL,一个受强化学习(RL)潜力启发的框架。具体而言,我们将策略梯度RL方法与精心设计的多个独特的CXR领域特定奖励模型相集成。该方法引导扩散去噪轨迹,实现精确的CXR姿态和病理细节。在此,考虑到复杂的医学图像环境,我们为奖励机制提出了“带比较反馈的强化学习”(RLCF),这是一种类似人类的比较评估,在复杂场景中比直接评估更有效、更可靠。我们的CXRL框架包括联合优化可学习的自适应条件嵌入(ACE)和图像生成器,使模型能够产生更准确且感知质量更高的CXR。我们在MIMIC-CXR-JPG数据集上的广泛评估证明了我们基于RL的微调方法的有效性。因此,我们的CXRL生成了病理上逼真的CXR,为生成高保真于真实临床场景的CXR确立了新标准。

关键词

引用

@article{arxiv.2403.06516,
  title  = {Advancing Text-Driven Chest X-Ray Generation with Policy-Based Reinforcement Learning},
  author = {Woojung Han and Chanyoung Kim and Dayun Ju and Yumin Shim and Seong Jae Hwang},
  journal= {arXiv preprint arXiv:2403.06516},
  year   = {2024}
}