中文

扩大取样范围:联合优化的 Pass@K 政策用于代码推理

计算与语言 2026-05-27 v1 人工智能

摘要

重复抽样并配合验证器是代码生成测试时计算分配的标准方法,pass@KK 作为标准度量标准。然而,标准的政策类会对单个答案分布进行 KK 次独立抽样,导致尝试常常坍缩到接近重复的推理路径,浪费预算上的冗余扩散。这种失败在竞赛编程中代价高昂,因为许多问题容纳多个不同的算法策略,而 pass@KK 只需一个正确尝试即可。我们提出联合优化的 Pass@KK 政策 (CPPO),将 pass@KK 生成转化为策略上的联合探索:规划器发出 K=4K{=}4 个备选高层方法的元组,共享求解器对每种方法尝试一个解。CPPO 通过乘性规划器奖励 Rplan=JψRoutR_{\mathrm{plan}} = J_\psi \cdot R_{\mathrm{out}} 对该联合政策进行训练,仅对导致验证器确认的 pass@KK 成功的有效策略元组分配信用。在 APPS、CodeContests 和 LiveCodeBench-v6 上,CPPO 在相同 K=4K{=}4 求解器尝试预算下,相较于直接抽样、规划基线、仅规划器 SFT 以及 pass@KK 导向的 RL,显著提升了 pass@44;在六个九个模型-基准单元中均实现统计显著提升。最大的单项提升为对 Qwen3.5-9B LiveCodeBench-v6 上 +0.16+0.16,相对于最强基线 PKPO (0.5880.7480.588 \rightarrow 0.748;配对 bootstrap,p<0.05p < 0.05)。

关键词

引用

@article{arxiv.2605.27000,
  title  = {Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning},
  author = {Yilong Li and Suman Banerjee and Tong Che},
  journal= {arXiv preprint arXiv:2605.27000},
  year   = {2026}
}

备注

Code reasoning; pass@K optimization; coordinated planning; verifiable rewards; strategy diversity