中文

通过单步奖励实现多轮代码生成

机器学习 2025-06-30 v2 人工智能 计算与语言

摘要

我们解决从多轮执行反馈生成代码的问题。现有方法要么在没有反馈的情况下生成代码,要么使用复杂的层次性强化学习来优化多轮奖励。我们提出一种简单且可扩展的方法,μ\muCode,通过仅使用单步奖励解决多轮代码生成。我们的关键洞察是,代码生成是一个可单步恢复的MDP,其中可以在单轮内从任何中间代码状态恢复正确代码。μ\muCode反复训练生成器以在多轮执行反馈条件下提供代码解决方案,同时训练验证器对新生成的代码进行评分。实验评估表明,我们的方法在最新方法之上取得显著改进。我们对奖励模型和策略的设计选择进行分析,展示μ\muCode在利用执行反馈方面的有效性。我们的代码已公开于 https://github.com/portal-cornell/muCode。

关键词

引用

@article{arxiv.2502.20380,
  title  = {Multi-Turn Code Generation Through Single-Step Rewards},
  author = {Arnav Kumar Jain and Gonzalo Gonzalez-Pumariega and Wayne Chen and Alexander M Rush and Wenting Zhao and Sanjiban Choudhury},
  journal= {arXiv preprint arXiv:2502.20380},
  year   = {2025}
}

备注

9 pages (not including references or appendix); 5 figures (in main paper); (v2) camera-ready version