BranchGRPO:基于扩散模型中结构化分支的稳定高效GRPO
计算机视觉与模式识别
2025-09-30 v5 人工智能
机器学习
摘要
近期在将Group Relative Policy Optimization (GRPO)应用于图像和视频生成模型方面取得了进展,显著提升了人类偏好对齐效果,但现有变体因顺序rollout、大量采样步骤以及信用分配不可靠(稀疏终端奖励在时间步上均匀传播,未能捕捉去噪过程中决策关键性)而效率较低。本文提出BranchGRPO,通过将rollout过程重构为分支树结构,其中共享前缀实现计算摊销,剪枝移除低价值路径和冗余深度。BranchGRPO引入三项贡献:(1) 分支方案通过共享前缀实现rollout成本摊销,同时保持探索多样性;(2) 奖励融合与深度相关优势估计,将稀疏终端奖励转化为稠密的步骤级信号;(3) 剪枝策略在保持前向rollout和探索不变的前提下,切断梯度计算。实验表明,在HPDv2.1图像对齐任务上,BranchGRPO相较于DanceGRPO将对齐得分提升最高可达\textbf{16\%},同时将每迭代训练时间降低近\textbf{55\%}。一种混合变体BranchGRPO-Mix进一步将训练速度加快至DanceGRPO的4.7倍,同时未引起对齐性能的下降。在WanX视频生成任务上,BranchGRPO相较于DanceGRPO实现更高的Video-Align得分,生成的帧更清晰且在时间上更一致。代码已公开。
引用
@article{arxiv.2509.06040,
title = {BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models},
author = {Yuming Li and Yikai Wang and Yuying Zhu and Zhongyu Zhao and Ming Lu and Qi She and Shanghang Zhang},
journal= {arXiv preprint arXiv:2509.06040},
year = {2025}
}
备注
12 pages, 6 figures