中文

超越代码生成:基于后条件评估代码 LLM 成熟度

软件工程 2024-07-22 v1

摘要

大多数现有代码大型语言模型(LLM)基准(如 EvalPlus)都聚焦于代码生成任务。也就是说,它们包含自然语言问题描述,并要求 LLM 编写代码以解决问题。我们认为这些基准未能衡量评估代码 LLM 质量所需的全部能力。本文提出一种基于后条件生成问题的代码 LLM 成熟度模型,以评估更完整的代码 LLM 能力。我们选择后条件生成问题,因为它要求代码 LLM 理解包括语义、自然语言在内的代码,并且具备生成编程语言中无歧义后条件的生成能力。此外,后条件具有各种类型,需要不同的能力水平,这使其适合评估代码 LLM 的成熟度。基于我们设计的成熟度模型,我们将 EvalPlus 数据集扩展为后条件测试基准,并对几个开源模型进行评估。我们的结果突显了为更好的代码 LLM 实现所需的改进。代码:https://github.com/MatureModel/PostcondGen

关键词

引用

@article{arxiv.2407.14118,
  title  = {Beyond Code Generation: Assessing Code LLM Maturity with Postconditions},
  author = {Fusen He and Juan Zhai and Minxue Pan},
  journal= {arXiv preprint arXiv:2407.14118},
  year   = {2024}
}