中文

PanGu-Coder2:利用排序反馈提升代码大语言模型

计算与语言 2023-07-28 v1 人工智能 机器学习 编程语言 软件工程

摘要

代码大语言模型(Code LLM)正蓬勃发展。新的强大模型以周为单位发布,在代码生成任务上展现出卓越性能。为提升预训练代码 LLM 的代码生成性能,已提出多种方法,如监督微调、指令微调、强化学习等。本文中,我们提出一种新颖的 RRTF(Rank Responses to align Test&Teacher Feedback,对响应排序以对齐测试与教师反馈)框架,可有效且高效地提升预训练大语言模型的代码生成能力。在该框架下,我们提出 PanGu-Coder2,其在 OpenAI HumanEval 基准上取得了 62.20% 的 pass@1。此外,通过在 CoderEval 与 LeetCode 基准上的广泛评估,我们表明 PanGu-Coder2 持续优于此前所有代码 LLM。

关键词

引用

@article{arxiv.2307.14936,
  title  = {PanGu-Coder2: Boosting Large Language Models for Code with Ranking Feedback},
  author = {Bo Shen and Jiaxin Zhang and Taihong Chen and Daoguang Zan and Bing Geng and An Fu and Muhan Zeng and Ailun Yu and Jichuan Ji and Jingyang Zhao and Yuenan Guo and Qianxiang Wang},
  journal= {arXiv preprint arXiv:2307.14936},
  year   = {2023}
}

备注

Preprint