基于强化学习的医学图像生成控制导向方法:利用视觉语言基础模型实现多样化生成
计算机视觉与模式识别
2025-07-08 v2
摘要
视觉语言基础模型(Vision-Language Foundation Models, VLFMs)在生成高分辨率、写实自然图像方面性能显著提升。尽管VLFMs在跨模态语义内容理解方面表现出丰富的能力,但在需要精确对应图像区域与文本描述细粒度对齐任务上常常难以满足,这在医学影像中尤为关键,因为准确的局部化和临床特征检测是诊断和分析的必不可少的要求。为此,我们提出了多阶段架构,其中预训练的VLFMs(如Stable Diffusion)提供初步的语义理解,而强化学习(RL)算法通过迭代过程不断优化对语义上下文的理解。奖励信号旨在对齐文本语义信息与合成图像的语义信息。在公开的ISIC2019皮肤病灶数据集上实验表明,所提方法在(a)生成图像质量和(b)与文本提示的对齐度方面均优于原始微调的Stable Diffusion基线。我们还展示,合成样本可用于通过增强提高欠representations子群的疾病分类器性能。我们的代码已在项目网站https://parhamsaremi.github.io/rl4med-ddpo 上公开。
引用
@article{arxiv.2503.15784,
title = {RL4Med-DDPO: Reinforcement Learning for Controlled Guidance Towards Diverse Medical Image Generation using Vision-Language Foundation Models},
author = {Parham Saremi and Amar Kumar and Mohamed Mohamed and Zahra TehraniNasab and Tal Arbel},
journal= {arXiv preprint arXiv:2503.15784},
year = {2025}
}