GrandCode:通过智能体强化学习实现竞赛编程大师级水平
人工智能
2026-04-06 v1
摘要
竞赛编程仍然是AI与人类对抗中最后几个人类堡垒之一。迄今为止最好的AI系统仍然不如最好的人类竞赛编程选手:最近最好的结果,Google的Gemini~3 Deep Think,在未在实时竞赛条件下评估的情况下获得了第八名。在这项工作中,我们引入了GrandCode,一个专为竞赛编程设计的多智能体强化学习系统。GrandCode的能力归功于两个关键因素:(1)它编排多种智能体模块(假设提出、求解器、测试生成器、摘要等),并通过后训练和在线测试时RL联合改进它们;(2)我们引入了专门针对多阶段智能体展开、延迟奖励以及智能体RL中普遍存在的严重离线策略漂移的Agentic GRPO。GrandCode是第一个在竞赛编程的实时比赛中持续击败所有人类参赛者的AI系统:在最近的三个Codeforces实时比赛中,即Round~1087(2026年3月21日)、Round~1088(2026年3月28日)和Round~1089(2026年3月29日),GrandCode在所有比赛中均排名第一,击败了所有人类参赛者,包括传奇级大师。GrandCode表明,AI系统已经达到了在最具竞争力的编程任务上超越最强人类程序员的地步。
引用
@article{arxiv.2604.02721,
title = {GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic Reinforcement Learning},
author = {DeepReinforce Team and Xiaoya Li and Xiaofei Sun and Guoyin Wang and Songqiao Su and Chris Shum and Jiwei Li},
journal= {arXiv preprint arXiv:2604.02721},
year = {2026}
}
备注
Tech Report; Pre-print