CoRe-Code:用于代码生成的协同强化学习
人工智能
2026-05-26 v1
摘要
大型语言模型(LLM)在代码生成方面取得了强大的性能,但大多数方法依赖于自回归解码而不进行全局规划,常导致在复杂任务上产生局部连贯但全局次优的解决方案(例如,测试用例失败或复杂度不足)。虽然最近的Chain-of-Thought(CoT)和多智能体系统(MAS)方法试图引入规划,但其有限的角色专化和协调能力在复杂任务上表现不足。为了解决多智能体代码生成中协调和专化的挑战,我们提出了Collaborative Reinforcement Code(CoRe-Code),即一种用于角色专化LLM智能体的框架,通过增强智能体之间的协调来生成更准确和更高效的代码。CoRe-Code采用简单的Planner-Coder范式,其中Planner产生高层计划,Coder执行计划以生成代码。我们进一步引入基于Group Relative Policy Optimization(GRPO)的协作感知强化学习阶段,以增强角色专化和对齐。实验表明,CoRe-Code在广泛的现有基于RL和多智能体方法上均表现出色。此外,我们展示了CoRe-Code可以推广到其他多智能体框架(例如检索和调试智能体),凸显了其灵活性和可扩展性。我们在难度不同的多个基准上对CoRe-Code进行了评估,使用三个基础模型。与现有基线方法相比,结果在准确性方面 consistently 获得改进,同时在执行时间和内存使用方面也实现了更高的效率,表明CoRe-Code的有效性和实用性。
引用
@article{arxiv.2605.24812,
title = {CoRe-Code: Collaborative Reinforcement Learning for Code Generation},
author = {Zhihao Dou and Qinjian Zhao and Zhongwei Wan and Xiaoyu Xia and Sumon Biswas},
journal= {arXiv preprint arXiv:2605.24812},
year = {2026}
}