中文

通过建模步骤级与长期抽样效应缓解稀疏奖励问题:基于流匹配的GRPO方法

计算机视觉与模式识别 2026-02-09 v1

摘要

将GRPO部署在流匹配模型上已证明有效用于文本到图像生成。然而,现有方法通常在所有前置去噪步骤上传播基于结果的奖励,而不区分每个步骤的局部影响。此外,当前的基于组的排序主要在匹配时间步上比较轨迹,忽略了轨迹内部的依赖关系,其中某些早期去噪动作可以通过延迟的、隐式的相互作用影响后续状态。我们提出了一种名为TurningPoint-GRPO(TP-GRPO)的GRPO框架,以缓解步骤级奖励稀疏性并显式建模去噪轨迹中的长期效应。TP-GRPO的两个关键创新点包括:(i) 将基于结果的奖励替换为步骤级增量奖励,提供稠密、步骤感知的学习信号,从而更好地隔离每个去噪动作的"纯粹"影响;(ii)识别翻转局部奖励趋势并使后续奖励演化与整体轨迹趋势一致的关键步骤,并为这些动作分配聚合的长期奖励以捕捉其延迟影响。关键点仅通过增量奖励的符号变化检测,使TP-GRPO高效且无需调参。大量实验还表明TP-GRPO更有效地利用奖励信号并持续改进生成效果。演示代码已公开于https://github.com/YunzeTong/TurningPoint-GRPO。

关键词

引用

@article{arxiv.2602.06422,
  title  = {Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO},
  author = {Yunze Tong and Mushui Liu and Canyu Zhao and Wanggui He and Shiyi Zhang and Hongwei Zhang and Peng Zhang and Jinlong Liu and Ju Huang and Jiamang Wang and Hao Jiang and Pipei Huang},
  journal= {arXiv preprint arXiv:2602.06422},
  year   = {2026}
}

备注

18 pages, in submission