中文

V-GRPO:面向去噪生成模型的在线强化学习比想象中更简单

机器学习 2026-04-28 v1 计算机视觉与模式识别

摘要

将去噪生成模型与人类偏好或可验证奖励对齐仍是关键挑战。虽然策略梯度在线强化学习 (RL) 提供了原则化的后训练框架,但其直接应用受限于这些模型的不可计算似然。先前的工作因此要么优化基于抽样轨迹的诱导马尔可夫决策过程 (MDP),该方法稳定但效率低下,要么使用基于扩散证据下界 (ELBO) 的似然代理项,这些代理项在视觉生成方面表现不佳。我们的关键洞察是,ELBO-基于方法实际上可以既稳定又高效。通过降低代理方差并控制梯度步长,我们展示了该方法可以战胜 MDP-基于的方法。为此,我们引入变分 GRPO (V-GRPO),一种将 ELBO-基于代理项与组相对策优化 (GRPO) 算法集成的 method,同时包含一组简单但至关重要的技术。我们的 method 易于实现,与预训练目标一致,避免了基于 MDP 的方法的局限性。V-GRPO 在文本到图像合成中实现了最佳性能,相较于 MixGRPO 实现了 2×2\times 的加速,相较于 DiffusionNFT 实现了 3×3\times 的加速。

关键词

引用

@article{arxiv.2604.23380,
  title  = {V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think},
  author = {Bingda Tang and Yuhui Zhang and Xiaohan Wang and Jiayuan Mao and Ludwig Schmidt and Serena Yeung-Levy},
  journal= {arXiv preprint arXiv:2604.23380},
  year   = {2026}
}