AR-GRPO:通过强化学习训练自回归图像生成模型
计算机视觉与模式识别
2025-08-12 v1
摘要
受强化学习在精炼大语言模型方面取得成功的启发,我们提出AR-GRPO,一种将在线强化学习训练集成到自回归图像生成模型中的方法。我们采用分组相对策略优化(GRPO)算法,通过精心设计的奖励函数来评估生成图像在多个质量维度上的表现,包括感知质量、真实感和语义保真度,从而精炼原始自回归模型的输出。我们在类别条件(即类别到图像)和文本条件(即文本到图像)图像生成任务上进行了全面实验,证明与标准自回归基线相比,我们的强化学习增强框架显著提升了生成图像的图像质量和人类偏好。我们的结果展示了在各种评估指标上的一致改进,确立了基于强化学习的优化在自回归图像生成中的可行性,并为可控和高质量图像合成开辟了新途径。源代码和模型可在以下地址获取:https://github.com/Kwai-Klear/AR-GRPO。
引用
@article{arxiv.2508.06924,
title = {AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning},
author = {Shihao Yuan and Yahui Liu and Yang Yue and Jingyuan Zhang and Wangmeng Zuo and Qi Wang and Fuzheng Zhang and Guorui Zhou},
journal= {arXiv preprint arXiv:2508.06924},
year = {2025}
}
备注
27 pages, 15 figures