中文

基于隐式优势的跳过连接策略优化

机器学习 2026-04-13 v1 计算与语言

摘要

组相对策略优化(GRPO)通过使用基于结果的奖励在RLVR中证明有效。虽然细粒度稠密奖励在理论上可以提升性能,但我们揭示了在实际抽样预算下,蒙特卡洛估计对早期推理标记会产生高方差和符号不一致的优势,反而低于仅基于结果的GRPO。我们提出了跳过连接优化(SKPO),将推理分解为上游和下游阶段:上游通过单流优化接收来自下游蒙特卡洞抽样的稠密奖励;下游维持组相对优化,其中跳过连接将上游片段与原始问题拼接,使模型能够利用有益的上游推理,同时保留通过直接访问问题来绕过错误推理的自由度。实验表明,在数学基准和包括一般推理和代码生成等跨域任务上,SKPO在Qwen2.5-Math-7B和Llama-3.2-3B上分别实现了3.91%和6.17%的相对提升。进一步分析显示,SKPO即使在最终正确性匹配的情况下,也会生成中间步骤质量更高的轨迹,揭示了隐式优势。

关键词

引用

@article{arxiv.2604.08690,
  title  = {Skip-Connected Policy Optimization for Implicit Advantage},
  author = {Fengwei Teng and Jinyi Bai and Xinhao Yao and Demi Ruohan Wang and Jiahao Zhao and Zhijiang Guo},
  journal= {arXiv preprint arXiv:2604.08690},
  year   = {2026}
}