中文

CoSPlay:基于自生成代码和单元测试的合作自我博弈

机器学习 2026-05-26 v2 人工智能 计算与语言

摘要

最近的强化学习可验证奖励(RLVR)和测试时间扩展(TTS)方法通过可执行验证推进了LLM代码生成。然而,真实单元测试(GT UTs)仍是瓶颈:SOTA RLVR方法需要它们进行高成本训练,而现有TTS方法在缺乏它们时失去竞争力。这激励GT-free TTS,即现有方法直接使用自生成的UTs来精炼和选择代码候选。然而,这些UTs常常噪声较大或与错误代码产生虚假耦合,UT质量也无法在没有可靠代码的情况下进行验证。关键挑战在于同步提高两者。为此,我们提出CoSPlay,一个GT-free、训练-free框架,通过合作自我博弈同步提高代码和UT。它首先探索多样化的解决方案思路并识别其潜在失效模式,以产生判别性UT思路。随后,利用来自Code-UT执行矩阵的双向计数信号,迭代修剪弱代码或修复不可靠UT,使两者池子协同演化。最后,当多个代码在最高计数中仍然持平时,选取最大输出共识簇中的最终代码,因为正确代码在相同输入上保持一致,而错误代码则发生分歧。在四个具有挑战性的基准测试上实验表明,CoSPlay在Qwen2.5-7B-Instruct上将平均BoN从22.1%提升至33.2%,UT准确率从14.6%提升至78.3%,匹配或超越RLVR模型CURE-7B。当应用于CURE-7B时,进一步提升BoN 5.7%。CoSPlay也在不同主干上具有广泛适应性,优于相当令人瞩目的GT-free TTS基线,随着预算扩展持续获得收益。这些结果表明,这是一种可扩展的推理策略,可在无任何GT数据的情况下实现竞争的代码生成。

关键词

引用

@article{arxiv.2605.23491,
  title  = {CoSPlay: Cooperative Self-Play at Test-Time with Self-Generated Code and Unit Test},
  author = {Zhangyi Hu and Chenhui Liu and Tian Huang and Jindong Li and Yang Yang and Jiemin Wu and Zining Zhong and Menglin Yang and Yutao Yue},
  journal= {arXiv preprint arXiv:2605.23491},
  year   = {2026}
}

备注

Code is available at: https://github.com/sanae-ai/CosPlay | Data & log is available at: https://huggingface.co/datasets/yomi017/CosPlay