UDM-GRPO:统一离散扩散模型的稳定高效组相对策略优化
计算机视觉与模式识别
2026-05-29 v4 机器学习
摘要
统一离散扩散模型(Uniform Discrete Diffusion Model, UDM)最近作为离散生成式建模的有前景的范式而涌现;然而,其与强化学习的集成仍在很大程度上未被探索。我们注意到, naively 将 GRPO 应用于 UDM 会导致训练不稳定和边际性能提升。为此,我们提出 UDM-GRPO,即首个将 UDM 与 RL 集成的框架。我们的方法受指导于两个关键洞见:(i) 将最终干净样本作为 action 可提供更准确且更稳定的优化信号;(ii) 通过扩散前向过程重建轨迹,可更好地对齐概率路径与预训练分布。此外,我们引入两个策略, Reduced-Step 与 CFG-Free,以进一步提高训练效率。UDM-GRPO 在多个 T2I 任务中显著提升了基线模型性能。值得注意的是,GenEval 准确率从 提升至 ,PickScore 从 提升至 ,在连续和离散设置中均实现最先进的性能。在 OCR 基准测试中,准确率从 提升至 ,进一步验证了我们方法的泛化能力。代码已公开于 https://github.com/Yovecent/UDM-GRPO。
引用
@article{arxiv.2604.18518,
title = {UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models},
author = {Jiaqi Wang and Haoge Deng and Ting Pan and Yang Liu and Chengyuan Wang and Fan Zhang and Yonggang Qi and Xinlong Wang},
journal= {arXiv preprint arXiv:2604.18518},
year = {2026}
}
备注
UDM-GRPO is accepted by ICML 2026 (Spotlight). Code is available at https://github.com/Yovecent/UDM-GRPO