中文

GAPO:面向真实世界代码大语言模型的鲁棒优势估计

机器学习 2026-01-09 v4 人工智能

摘要

强化学习(RL)广泛用于代码编辑中大语言模型(LLM)的后训练,其中基于组相对的方法(如GRPO)因其无需评论家且具有归一化优势估计而广受欢迎。然而,在真实世界的代码编辑场景中,奖励分布通常偏斜且伴有不可预测的噪声,导致优势计算失真并增加轨迹异常值。为解决此问题,我们提出组自适应策略优化(GAPO),该方法自适应地为每个提示找到信噪比(SNR)最高的区间,并使用该区间的中位数作为自适应Q值,以替代优势计算中的组均值,从而进一步降低噪声。这种自适应Q值能稳健处理轨迹噪声,同时保持即插即用和高效率。我们在收集的包含51,844个真实世界、历史感知的代码编辑任务(涵盖10种编程语言)的大规模数据集上,对九个指令微调的大语言模型(3B-14B)进行了评估。与GRPO及其变体DAPO相比,GAPO在域内(ID)和域外(OOD)的精确匹配上分别提升了最多4.35和5.30,同时实现了更低的裁剪比率和更高的GPU吞吐量。代码:https://github.com/TsingZ0/verl-GAPO。

关键词

引用

@article{arxiv.2510.21830,
  title  = {GAPO: Robust Advantage Estimation for Real-World Code LLMs},
  author = {Jianqing Zhang and Zhezheng Hao and Wei Xia and Hande Dong and Hong Wang and Chenxing Wei and Yuyan Zhou and Yubin Qi and Qiang Lin and Jian Cao},
  journal= {arXiv preprint arXiv:2510.21830},
  year   = {2026}
}