CodeFuse-13B:一个预训练的多语言代码大语言模型
软件工程
2024-01-18 v2 人工智能
机器学习
摘要
代码大语言模型(Code LLM)因其在软件工程全生命周期中的广泛应用而在工业界受到显著关注。然而,现有模型在理解非英语输入以处理多语言代码相关任务方面的有效性仍远未得到充分研究。本文介绍了 CodeFuse-13B,一个开源的预训练代码 LLM。它专为涉及中英文提示的代码相关任务设计,并支持超过 40 种编程语言。CodeFuse 通过利用由程序分析器仔细过滤并在训练过程中优化得到的高质量预训练数据集来实现其有效性。我们使用真实世界使用场景、工业标准基准 HumanEval-x 以及专为中文提示设计的 CodeFuseEval 进行了大量实验。为评估 CodeFuse 的有效性,我们主动从蚂蚁集团(AntGroup)的软件开发过程中收集了宝贵的人类反馈,CodeFuse 已在该过程中成功部署。结果表明,CodeFuse-13B 取得了 37.10% 的 HumanEval pass@1 分数,使其成为同等参数规模下顶尖的多语言代码 LLM 之一。在代码生成、代码翻译、代码注释和测试用例生成等实际场景中,面对中文提示时 CodeFuse 的表现优于其他模型。
引用
@article{arxiv.2310.06266,
title = {CodeFuse-13B: A Pretrained Multi-lingual Code Large Language Model},
author = {Peng Di and Jianguo Li and Hang Yu and Wei Jiang and Wenting Cai and Yang Cao and Chaoyu Chen and Dajun Chen and Hongwei Chen and Liang Chen and Gang Fan and Jie Gong and Zi Gong and Wen Hu and Tingting Guo and Zhichao Lei and Ting Li and Zheng Li and Ming Liang and Cong Liao and Bingchang Liu and Jiachen Liu and Zhiwei Liu and Shaojun Lu and Min Shen and Guangpei Wang and Huan Wang and Zhi Wang and Zhaogui Xu and Jiawei Yang and Qing Ye and Gehao Zhang and Yu Zhang and Zelin Zhao and Xunjin Zheng and Hailian Zhou and Lifu Zhu and Xianying Zhu},
journal= {arXiv preprint arXiv:2310.06266},
year = {2024}
}
备注
Accepted by ICSE-SEIP 2024