中文

M2rc-Eval:大规模多语言仓库级代码补全评估

计算与语言 2024-10-29 v1 软件工程

摘要

仓库级代码补全在软件工程中引起了极大关注,并且已经引入了多个基准数据集。然而,现有的仓库级代码补全基准通常只关注有限数量的语言(少于5种),这无法评估现有代码大语言模型(LLMs)跨不同语言的通用代码智能能力。此外,现有基准通常报告不同语言的整体平均分数,而忽略了不同补全场景下的细粒度能力。因此,为了促进代码 LLMs 在多语言场景中的研究,我们提出了一个覆盖 18 种编程语言的大规模多语言仓库级代码补全基准(称为 M2RC-EVAL),并提供了两种类型的细粒度标注(即桶级和语义级),这些标注是基于解析的抽象语法树获得的。此外,我们还整理了一个大规模多语言指令语料库 M2RC-INSTRUCT 数据集,以提升现有代码 LLMs 的仓库级代码补全能力。全面的实验结果证明了我们的 M2RC-EVAL 和 M2RC-INSTRUCT 的有效性。

关键词

引用

@article{arxiv.2410.21157,
  title  = {M2rc-Eval: Massively Multilingual Repository-level Code Completion Evaluation},
  author = {Jiaheng Liu and Ken Deng and Congnan Liu and Jian Yang and Shukai Liu and He Zhu and Peng Zhao and Linzheng Chai and Yanan Wu and Ke Jin and Ge Zhang and Zekun Wang and Guoan Zhang and Bangyu Xiang and Wenbo Su and Bo Zheng},
  journal= {arXiv preprint arXiv:2410.21157},
  year   = {2024}
}

备注

19 pages