利用 GRPO 提升 LLM 生成代码的质量
人工智能
2025-06-04 v1
摘要
大语言模型(LLM)在代码生成中的应用日益广泛。近期的训练流程将执行反馈作为奖励信号,通常侧重于代码的功能正确性,使用单元测试通过率作为奖励信号。然而,这种奖励信号无法捕捉所生成代码的可维护性、质量与安全性等概念。我们针对这一研究不足的领域,开发了一个综合库来量化代码质量的各个方面,并将其作为 GRPO 中的奖励。我们发现 GRPO 根据该指标提升了代码质量,这一结论已由专家盲测人工标注员证实。
引用
@article{arxiv.2506.02211,
title = {Improving LLM-Generated Code Quality with GRPO},
author = {Maxime Robeyns and Laurence Aitchison},
journal= {arXiv preprint arXiv:2506.02211},
year = {2025}
}