中文

超越 pass@k:面向多采样代码生成的冗余感知强化学习人类反馈

计算与语言 2026-05-28 v1 软件工程

摘要

用于代码生成的大语言模型通常在重复采样设置下使用 Pass@k 进行评估,在有限采样预算下对多个候选程序执行单元测试。虽然最近的基于验证器的强化学习 (RLVR) 方法提高了可执行正确性,但这些目标如何影响采样程序之间的冗余性仍鲜为人知。本文使用代码抄袭检测系统 JPlag 研究代码生成中的实现层级冗余。我们在不同模型和基准上展示,仅正确性的 RLVR 方法会将生成集中在重复实现上,而 Pass@k 感知目标保持更低的冗余度并提升大预算下的性能。针对这些观察,我们增强了基于 JPlag 相似度的直接反冗余奖励的 RLVR。在 3 个模型和 3 个基准上,抑制接近重复生成可靠地改善有限预算下的可执行性能,常常匹配或超越专门的 Pass@k 感知目标。

关键词

引用

@article{arxiv.2605.28022,
  title  = {Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation},
  author = {Le Bronnec Florian and Alexandre Verine and Rio Yokota and Benjamin Negrevergne},
  journal= {arXiv preprint arXiv:2605.28022},
  year   = {2026}
}

备注

Preprint under review