中文

面向 AR-diffusion 混合图像生成的稳定化 GRPO

计算机视觉与模式识别 2026-04-09 v1

摘要

强化学习(RL)已成功应用于自回归(AR)和扩散模型。然而,由于推理交错和噪声对数概率估计,扩展 RL 到混合 AR-diffusion 框架仍具有挑战。本文研究了掩码自回归模型(MAR),指出扩散头在训练动力学中发挥关键作用,常会引入噪声梯度,导致不稳定和早期性能饱和。为解决此问题,我们提出一种用于 MAR 的稳定化 RL 框架。我们引入多轨迹期望(MTE),通过对多个扩散轨迹求平均来估计优化方向,从而降低扩散引起的梯度噪声。为避免过度平滑,我们进一步从多个轨迹中估计每个 token 的不确定性,并仅对最不确定的 top-k% token 应用多轨迹优化。此外,我们引入一致性感知的 token 选择策略,以过滤掉与最终生成内容不够匹配的 AR token。广泛的实验结果表明,我们的方法在视觉质量、训练稳定性和空间结构理解方面 consistently 优于基线 GRPO 和预 RL 模型。代码已公开:https://github.com/AMAP-ML/mar-grpo。

关键词

引用

@article{arxiv.2604.06966,
  title  = {MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation},
  author = {Xiaoxiao Ma and Jiachen Lei and Tianfei Ren and Jie Huang and Siming Fu and Aiming Hao and Jiahong Wu and Xiangxiang Chu and Feng Zhao},
  journal= {arXiv preprint arXiv:2604.06966},
  year   = {2026}
}