中文

利用 GRPO 提升 LLM 生成代码的质量

人工智能 2025-06-04 v1

摘要

大语言模型(LLM)在代码生成中的应用日益广泛。近期的训练流程将执行反馈作为奖励信号,通常侧重于代码的功能正确性,使用单元测试通过率作为奖励信号。然而,这种奖励信号无法捕捉所生成代码的可维护性、质量与安全性等概念。我们针对这一研究不足的领域,开发了一个综合库来量化代码质量的各个方面,并将其作为 GRPO 中的奖励。我们发现 GRPO 根据该指标提升了代码质量,这一结论已由专家盲测人工标注员证实。

关键词

引用

@article{arxiv.2506.02211,
  title  = {Improving LLM-Generated Code Quality with GRPO},
  author = {Maxime Robeyns and Laurence Aitchison},
  journal= {arXiv preprint arXiv:2506.02211},
  year   = {2025}
}