中文

单元测试代码奖励建模的动态规模扩展

计算与语言 2025-01-03 v1 软件工程

摘要

当前大型语言模型(LLM)在处理如代码生成等复杂推理任务时,常常难以首次生成准确的响应。以往的研究通过生成多个候选解决方案并用 LLM 生成的单元测试对其进行验证来解决此挑战。单元测试的执行结果作为奖励信号,用于识别正确的解决方案。由于 LLM 总是自信地出错,这些单元测试并不可靠,从而削弱了奖励信号的质量。受候选方案数量提升 LLM 性能的观察启发,我们探讨了扩展单元测试以增强奖励信号质量的影响。我们的初步实验揭示,单元测试数量与奖励信号质量之间存在正相关关系,对于更具挑战性的问题,提升效果更为显著。基于这些发现,我们提出 CodeRM-8B,一种轻量且有效的单元测试生成器,能够高效且高质量地实现单元测试规模扩展。此外,我们实现了一个动态规模机制,根据问题难度自适应地调整单元测试数量,从而进一步提高效率。实验结果表明,我们的方法在三个基准测试中显著提升了 various 模型的性能(例如,Llama3-8B 提升 18.43%,GPT-4o-mini 提升 3.42%)。

关键词

引用

@article{arxiv.2501.01054,
  title  = {Dynamic Scaling of Unit Tests for Code Reward Modeling},
  author = {Zeyao Ma and Xiaokang Zhang and Jing Zhang and Jifan Yu and Sijia Luo and Jie Tang},
  journal= {arXiv preprint arXiv:2501.01054},
  year   = {2025}
}

备注

Homepage: https://code-reward-model.github.io/