中文

DanceGRPO:在视觉生成上 unleashing GRPO

机器人学 2025-08-29 v2 计算机视觉与模式识别

摘要

近期生成式AI的进展正在革新视觉内容的创建,但与人类偏好一致的模型输出仍然是一个关键挑战。虽然强化学习(RL)作为微调生成模型的有前景的方法,但现有方法如DDPO和DPOK面临根本性限制——特别是在扩展到大规模多样化提示集时无法维持稳定优化,严重限制了其实际实用性。本文提出DanceGRPO,通过对Group Relative Policy Optimization(GRPO)的创新适应来解决这些限制。我们的关键洞察是,GRPO的固有稳定性机制独特地 positioned to克服先前基于RL的方法在视觉生成任务中所面临的优化挑战。DanceGRPO在多个现代生成范式(包括扩散模型和rectified flows)上 demonstrate consistent and stable policy optimization(一致且稳定的策略优化)。在扩展到复杂真实场景(涵盖三个关键任务和四个基础模型)时,保持稳健性能。在针对五种不同奖励模型优化多样化人类偏好方面表现突出,这些奖励模型分别评估图像/视频的美学、文本-图像对齐、视频运动质量和二进制反馈。我们的全面实验结果显示,DanceGRPO在多个 established benchmarks(包括HPS-v2.1、CLIP Score、VideoAlign和GenEval)上 outperform baseline methods(超越基线方法),提升幅度最高可达181%。我们的结果将DanceGRPO确立为扩展强化学习从人类反馈(RLHF)任务在视觉生成中的 robust and versatile solution(稳健且通用的解决方案),为和谐化强化学习与视觉合成提供了新的见解。

关键词

引用

@article{arxiv.2505.07817,
  title  = {Pixel Motion as Universal Representation for Robot Control},
  author = {Kanchana Ranasinghe and Xiang Li and E-Ro Nguyen and Cristina Mata and Jongwoo Park and Michael S Ryoo},
  journal= {arXiv preprint arXiv:2505.07817},
  year   = {2025}
}