扩大取样范围:联合优化的 Pass@K 政策用于代码推理
计算与语言
2026-05-27 v1 人工智能
摘要
重复抽样并配合验证器是代码生成测试时计算分配的标准方法,pass@ 作为标准度量标准。然而,标准的政策类会对单个答案分布进行 次独立抽样,导致尝试常常坍缩到接近重复的推理路径,浪费预算上的冗余扩散。这种失败在竞赛编程中代价高昂,因为许多问题容纳多个不同的算法策略,而 pass@ 只需一个正确尝试即可。我们提出联合优化的 Pass@ 政策 (CPPO),将 pass@ 生成转化为策略上的联合探索:规划器发出 个备选高层方法的元组,共享求解器对每种方法尝试一个解。CPPO 通过乘性规划器奖励 对该联合政策进行训练,仅对导致验证器确认的 pass@ 成功的有效策略元组分配信用。在 APPS、CodeContests 和 LiveCodeBench-v6 上,CPPO 在相同 求解器尝试预算下,相较于直接抽样、规划基线、仅规划器 SFT 以及 pass@ 导向的 RL,显著提升了 pass@;在六个九个模型-基准单元中均实现统计显著提升。最大的单项提升为对 Qwen3.5-9B LiveCodeBench-v6 上 ,相对于最强基线 PKPO (;配对 bootstrap,)。
引用
@article{arxiv.2605.27000,
title = {Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning},
author = {Yilong Li and Suman Banerjee and Tong Che},
journal= {arXiv preprint arXiv:2605.27000},
year = {2026}
}
备注
Code reasoning; pass@K optimization; coordinated planning; verifiable rewards; strategy diversity