中文

在语法感知代码填空任务上评估 LLM

计算与语言 2024-06-25 v3 人工智能 机器学习 软件工程

摘要

我们引入了 Syntax-Aware Fill-In-the-Middle (SAFIM),一个用于评估大型语言模型在代码 Fill-in-the-Middle (FIM) 任务上的新基准。该基准专注于程序结构(如代码块和条件表达式)的语法感知补全,包含来自多种编程语言的 17,720 个示例,数据源自 2022 年 4 月之后的近期代码提交,以最大程度减少数据污染。SAFIM 提供了一个稳健的框架,具备多种提示设计和新颖的语法感知后处理技术,促进了 LLM 之间准确且公平的比较。我们对 15 个 LLM 的全面评估表明,FIM 预训练不仅提升了 FIM 能力,还改善了使用 LLM 的从左到右(L2R)推理。我们的发现挑战了传统观念,表明预训练方法和数据质量的影响大于模型规模。因此,SAFIM 可作为未来代码 LLM 有效预训练策略研究的基础平台。评估工具包和数据集可在 https://github.com/gonglinyuan/safim 获取,排行榜可在 https://safimbenchmark.com 获取。

关键词

引用

@article{arxiv.2403.04814,
  title  = {Evaluation of LLMs on Syntax-Aware Code Fill-in-the-Middle Tasks},
  author = {Linyuan Gong and Sida Wang and Mostafa Elhoushi and Alvin Cheung},
  journal= {arXiv preprint arXiv:2403.04814},
  year   = {2024}
}

备注

22 pages; ICML 2024 Oral: https://icml.cc/virtual/2024/oral/35482