中文

外推权平均揭示代码强化学习中的正确性-效率前沿

机器学习 2026-05-28 v1 人工智能 计算与语言

摘要

对 fine-tuned 检查点之间的线性插值已被证明可追踪在竞争目标之间的 Pareto 前沿,但是否可以通过外推权平均将此类前沿延伸至推断时有用的新检查点,而无需额外 RL 训练,尚不明确。我们在竞争编程中研究此问题,其中隐藏单元测试在时间和内存限制下强制实现功能正确性和计算效率。从共享初始化开始,我们在嵌套单元测试覆盖下训练检查点:低覆盖奖励要求通过较小输入测试,而高覆盖奖励要求通过逐步增大的测试直至完整测试套件。此扫荡揭示了正确性-效率前沿的出现:在困难问题上,更高的覆盖奖励减少优化失败但增加正确性失败,使解题率几乎不变。对低覆盖和高覆盖检查点的插值恢复此前沿,而外推将其延伸至训练端点之外。无论是前沿及其外推延续,还是在纯推理、工具使用和 agentic 编码三个推断设置中,还是在 32B 和 7B 两个模型规模中,都可见。层面上,关键前沿上的移动改变解决哪些问题,使外推检查点在推断时扩展性中互补。以外推权平均为基础的集团在 LCB/hard 上的 pass@250 提升 3.3%,超过在匹配样本预算下的最佳单一检查点。这些结果表明,嵌套单元测试覆盖在代码 RL 中诱导一个前沿,外推权平均可导航、延伸并利用。

关键词

引用

@article{arxiv.2605.28751,
  title  = {Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL},
  author = {Kunhao Zheng and Pierre Chambon and Juliette Decugis and Jonas Gehring and Taco Cohen and Benjamin Negrevergne and Gabriel Synnaeve},
  journal= {arXiv preprint arXiv:2605.28751},
  year   = {2026}
}

备注

54 pages