STAGE:面向自回归图像生成的稳定且可泛化的 GRPO
计算机视觉与模式识别
2025-09-30 v1
摘要
近期已有研究探索利用强化学习来改进文本到图像的生成,然而将现有的 GRPO 算法应用于自回归 (AR) 图像模型仍具挑战。训练过程的不稳定性在长时间运行中极易破坏预训练模型的能力,导致收益微乎其微、图像质量下降以及泛化能力变差。在本工作中,我们重新审视了 AR 图像生成中的 GRPO,并指出了两个关键问题:来自不必要 token 的矛盾梯度以及不稳定的策略熵动态。为解决这些问题,我们引入了 STAGE,这是一个稳定且可泛化的框架,利用了两个针对性解决方案:1) 优势/KL 重加权。采用感知相似性的重加权来缓解冲突更新;2) 熵奖励。采用基于参考模型的熵奖励来稳定学习。通过缓解 token 间的冲突以及利用熵奖励稳定训练,我们减少了对预训练分布的破坏并减轻了奖励黑客行为,这反过来提升了泛化能力并使其能更好地迁移至其他基准。在多个基准上的实验表明,与基线 GRPO 相比,STAGE 持续提升了视觉质量、稳定性以及跨任务泛化能力。
引用
@article{arxiv.2509.25027,
title = {STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation},
author = {Xiaoxiao Ma and Haibo Qiu and Guohui Zhang and Zhixiong Zeng and Siqi Yang and Lin Ma and Feng Zhao},
journal= {arXiv preprint arXiv:2509.25027},
year = {2025}
}
备注
Code available at https://github.com/krennic999/STAGE