OP-GRPO:面向流匹配模型的高效离线策略 GRPO
计算机视觉与模式识别
2026-04-07 v1
摘要
通过 GRPO 进行的后训练已被证明在提升流匹配模型的生成质量方面具有显著效果。然而,GRPO 由于其在线策略训练范式而存在固有的低样本效率。为解决这一局限,我们提出了 OP-GRPO,即首个面向流匹配模型的离线策略 GRPO 框架。首先,我们主动选择高质量轨迹并自适应地将它们纳入回放缓冲区,以便在后续训练迭代中复用。其次,为缓解离线策略样本引入的分布偏移,我们提出了一种序列级重要性采样校正,在保持 GRPO 裁剪机制完整性的同时确保稳定的策略更新。第三,我们在理论和实证上证明,后期去噪步骤会产生病态的离线策略比率,并通过截断后期步骤轨迹来缓解这一问题。在图像和视频生成基准测试中,OP-GRPO 仅使用平均 34.2% 的训练步骤即达到了与 Flow-GRPO 相当或更优的性能,在保持生成质量的同时显著提升了训练效率。
引用
@article{arxiv.2604.04142,
title = {OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models},
author = {Liyu Zhang and Kehan Li and Tingrui Han and Tao Zhao and Yuxuan Sheng and Shibo He and Chao Li},
journal= {arXiv preprint arXiv:2604.04142},
year = {2026}
}