中文

UDM-GRPO:统一离散扩散模型的稳定高效组相对策略优化

计算机视觉与模式识别 2026-05-29 v4 机器学习

摘要

统一离散扩散模型(Uniform Discrete Diffusion Model, UDM)最近作为离散生成式建模的有前景的范式而涌现;然而,其与强化学习的集成仍在很大程度上未被探索。我们注意到, naively 将 GRPO 应用于 UDM 会导致训练不稳定和边际性能提升。为此,我们提出 UDM-GRPO,即首个将 UDM 与 RL 集成的框架。我们的方法受指导于两个关键洞见:(i) 将最终干净样本作为 action 可提供更准确且更稳定的优化信号;(ii) 通过扩散前向过程重建轨迹,可更好地对齐概率路径与预训练分布。此外,我们引入两个策略, Reduced-Step 与 CFG-Free,以进一步提高训练效率。UDM-GRPO 在多个 T2I 任务中显著提升了基线模型性能。值得注意的是,GenEval 准确率从 69%69\% 提升至 96%96\%,PickScore 从 20.4620.46 提升至 23.8123.81,在连续和离散设置中均实现最先进的性能。在 OCR 基准测试中,准确率从 8%8\% 提升至 57%57\%,进一步验证了我们方法的泛化能力。代码已公开于 https://github.com/Yovecent/UDM-GRPO。

关键词

引用

@article{arxiv.2604.18518,
  title  = {UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models},
  author = {Jiaqi Wang and Haoge Deng and Ting Pan and Yang Liu and Chengyuan Wang and Fan Zhang and Yonggang Qi and Xinlong Wang},
  journal= {arXiv preprint arXiv:2604.18518},
  year   = {2026}
}

备注

UDM-GRPO is accepted by ICML 2026 (Spotlight). Code is available at https://github.com/Yovecent/UDM-GRPO