GRPO-Guard:通过受控裁切消除流匹配中的隐式过度优化
计算机视觉与模式识别
2025-10-31 v2 机器学习
摘要
最近,基于GRPO的强化学习在优化流匹配模型方面取得了显著进展,有效提升了其与任务特定奖励的对齐程度。在这些框架中,策略更新依赖于重要性比值裁切以约束过于自信的正负梯度。然而,实际操作中,我们观察到重要性比值分布出现系统性偏移——其均值低于1且在各时间步的方差差异显著。这一左偏移且不一致的分布会导致正优势样本无法进入裁切区域,从而导致该机制在约束过于自信的正向更新方面失效。结果,策略模型不可避免地进入隐式过度优化阶段——尽管代理奖励持续上升,诸如图像质量和文本提示对齐等关键指标会急剧恶化,最终使所学策略难以用于实际应用。为解决此问题,我们引入GRPO-Guard,这是一种简单而有效的GRPO框架增强方法。该方法包含比值归一化,恢复重要性比值的平衡性和步骤一致性,确保PPO裁切能够在去噪时间步正确约束有害更新。此外,一种梯度重加权策略在噪声条件下均等化策略梯度,防止特定时间步区域产生过度更新。这些设计共同构成一种受控裁切机制,稳定优化过程,显著降低隐式过度优化程度,无需依赖严格的KL正则化。针对多个扩散模型主干(如SD3.5M、Flux.1-dev)和多样化代理任务进行大量实验表明,GRPO-Guard在保持或甚至提升生成质量的同时,显著减少了过度优化现象。
引用
@article{arxiv.2510.22319,
title = {GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping},
author = {Jing Wang and Jiajun Liang and Jie Liu and Henglin Liu and Gongye Liu and Jun Zheng and Wanyuan Pang and Ao Ma and Zhenyu Xie and Xintao Wang and Meng Wang and Pengfei Wan and Xiaodan Liang},
journal= {arXiv preprint arXiv:2510.22319},
year = {2025}
}
备注
Project Page: https://jingw193.github.io/GRPO-Guard/