中文

BPPO:高效 GRPO 风格推理 RL 的二进制前缀策略优化

机器学习 2026-05-28 v1

摘要

Group Relative Policy Optimization (GRPO) 广泛用于训练推理模型,但在每个组中更新所有采样完成项会产生 substantial cost,并可能强化冗长的推理轨迹。本文研究所有完成项在 GRPO 风格推理 RL 中是否提供等效有用的更新信号。我们的梯度相似性分析表明,在同一提示组内,同一类别的完成项常导致高度相似的更新方向,而正确-错误配对提供更具对比性的信号。基于这些观察,我们提出 Binary Prefix Policy Optimization (BPPO),其使用最短正确完成项和最短错误完成项作为紧凑更新单元,同时保持全组优势归一化。BPPO 进一步通过自适应完成调度和前缀聚焦优化提高效率;通过仅更新响应前缀,它避免了强化冗余后缀并鼓励更简洁的响应。GSM8K、MATH 和 Geo3K 上的实验表明,BPPO 在保持有竞争力准确率的同时,相对于 GRPO 实现最高可达 6.08 倍的加速,并在不修改奖励且不施加显式长度惩罚的前提下,将平均响应长度缩短约 30-50%。

关键词

引用

@article{arxiv.2605.28028,
  title  = {BPPO: Binary Prefix Policy Optimization for Efficient GRPO-Style Reasoning RL with Concise Responses},
  author = {Qingfei Zhao and Huan Song and Shuyu Tian and Jiawei Shao and Xuelong Li},
  journal= {arXiv preprint arXiv:2605.28028},
  year   = {2026}
}