基于混合ODE-SDE的GRPO效率提升:MixGRPO框架
人工智能
2026-03-23 v6 计算机视觉与模式识别
摘要
虽然GRPO显著提升了流匹配模型在图像生成的人类偏好对齐方面的效果,但FlowGRPO和DanceGRPO等方法仍因必须对Markov决策过程(MDP)中指定的全部去噪步骤进行抽样和优化而效率低下。本文提出MixGRPO——一种新型框架,利用通过将随机微分方程(SDE)和普通微分方程(ODE)集成的混合抽样策略的灵活性,旨在提升效率并增强性能。具体而言,MixGRPO引入滑动窗口机制,在窗口内使用SDE抽样和GRPO引导的优化,而在窗口外部应用ODE抽样。该设计将抽样随机性限制在窗口内的时间步长,从而降低优化开销,使梯度更新更聚焦,加快收敛速度。此外,由于滑动窗口之外的时间步长不参与优化,支持更高阶求解器以实现更快抽样。我们又提出更高效的变体MixGRPO-Flash,进一步提升训练效率,同时保持相当的性能。MixGRPO在多个维度的人类偏好对齐方面实现显著提升,无论在有效性还是效率方面都优于DanceGRPO,训练时间几乎降低50%。尤其值得注意的是,MixGRPO-Flash进一步将训练时间缩减71%。
引用
@article{arxiv.2507.21802,
title = {MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE},
author = {Junzhe Li and Yutao Cui and Tao Huang and Yinping Ma and Chun Fan and Yiming Cheng and Miles Yang and Zhao Zhong and Liefeng Bo},
journal= {arXiv preprint arXiv:2507.21802},
year = {2026}
}