CodeBoost:通过压缩代码片段知识来提升代码大语言模型
计算与语言
2025-08-08 v1
摘要
代码大语言模型(LLM)已成为构建高效自动化编码管道的必不可少工具。现有模型通常采用强化学习(RL)从通用型大语言模型进行后训练,使用“人类指令-最终答案”配对,其中指令通常来自手动标注。然而,收集高质量的编码指令既耗时又难以规模化。另一方面,代码片段来自各种来源且资源丰富。这种不平衡为基于指令的后训练带来了主要瓶颈。我们提出CodeBoost,一种纯从代码片段中提升代码大语言模型的后训练框架,无需依赖人工标注的指令。CodeBoost引入了以下关键组件:(1)最大团精选,从代码中选择代表性且多样化的训练语料;(2)双向预测,使模型能够从前向和后向预测目标中学习;(3)错误感知预测,纳入正确和错误输出的学习信号;(4)异构增强,多样化训练分布以丰富代码语义;(5)异构奖励,通过包括格式正确性和来自成功与失败的执行反馈等多种奖励类型指导模型学习。广泛的实验在多个代码LLM和基准测试上验证了CodeBoost consistently improve performance,证明其作为可扩展且高效训练管道的有效性。
引用
@article{arxiv.2508.05242,
title = {CodeBoost: Boosting Code LLMs by Squeezing Knowledge from Code Snippets with RL},
author = {Sijie Wang and Quanjiang Guo and Kai Zhao and Yawei Zhang and Xin Li and Xiang Li and Siqi Li and Rui She and Shangshu Yu and Wee Peng Tay},
journal= {arXiv preprint arXiv:2508.05242},
year = {2025}
}
备注
Technical report. Project page: https://github.com/sijieaaa/CodeBoost