将 GRPO 应用于视觉生成:DanceGRPO
计算机视觉与模式识别
2025-08-29 v4
摘要
近期生成式 AI 的进展正在革新视觉内容的创建,但与人类偏好相一致的模型输出仍是一个关键挑战。尽管强化学习( RL)作为微调生成模型的 promising 方法,但现有方法如 DDPO 和 DPOK 面临根本性限制——特别是在扩展到大规模和多样化提示集时无法维持稳定的优化,从而严重限制了实际应用价值。本文提出了 DanceGRPO 框架,通过创新性地将群体相对策略优化( GRPO) 适用于视觉生成任务。我们的关键洞察是,GRPO 的固有稳定性机制独特地 positioned 克服了先前基于 RL 的方法在视觉生成中所面临的优化挑战。DanceGRPO 在多个重要方面实现了显著突破:首先,在多个现代生成范式(包括扩散模型和整流流)上 demonstrate 了一致且稳定的策略优化;其次,在扩展到复杂真实场景时表现稳健,涵盖三个关键任务和四个基础模型;第三,在针对五种不同奖励模型(评估图像/视频审美、文本-图像对齐、视频运动质量和二元反馈)的 diverse human preferences 时,展现出惊人的优化能力。我们的全面实验结果表明,DanceGRPO 在多个既定基准(包括 HPS-v2.1、CLIP Score、VideoAlign 和 GenEval)上 outperform baseline 方法,提升幅度最高可达 181%。我们的结果将 DanceGRPO 确立为扩大强化学习从人类反馈( RLHF)在视觉生成任务中的应用的 robust and versatile solution,为理解强化学习与视觉合成的和谐提供了新的见解。
引用
@article{arxiv.2505.07818,
title = {DanceGRPO: Unleashing GRPO on Visual Generation},
author = {Zeyue Xue and Jie Wu and Yu Gao and Fangyuan Kong and Lingting Zhu and Mengzhao Chen and Zhiheng Liu and Wei Liu and Qiushan Guo and Weilin Huang and Ping Luo},
journal= {arXiv preprint arXiv:2505.07818},
year = {2025}
}
备注
Project Page: https://dancegrpo.github.io/