中文

代码生成基准的质量评估:我们星星中的错误

软件工程 2024-09-05 v3 机器学习

摘要

大型语言模型(LLMs)在软件工程师中日益流行。开发有效的代码生成LLM的关键环节之一是使用稳健的基准来评估这些模型。存在质量问题的评估基准可能会提供虚假的性能表现。在这项工作中,我们首次对用于比较不同代码生成模型性能的基准中的提示质量进行了研究。为开展此项研究,我们分析了来自9个代码生成基准的3566个提示,以识别其中的质量问题。我们还研究了修复基准提示中已识别质量问题是否会影响模型性能。此外,我们研究了评估数据集中的记忆化问题,该问题可能质疑基准的可信度。我们发现代码生成评估基准主要关注Python和编程练习题,且上下文依赖关系非常有限,难以挑战模型。这些数据集和开发者提示存在拼写与语法错误、表达开发者意图的句子不清晰、未使用恰当的文档风格等质量问题。修复基准中的所有这些问题可以提升Python代码生成的性能,但Java代码生成未见显著改善。我们还发现GPT-3.5-Turbo和CodeGen-2.5模型可能存在数据污染问题的证据。

关键词

引用

@article{arxiv.2404.10155,
  title  = {The Fault in our Stars: Quality Assessment of Code Generation Benchmarks},
  author = {Mohammed Latif Siddiq and Simantika Dristi and Joy Saha and Joanna C. S. Santos},
  journal= {arXiv preprint arXiv:2404.10155},
  year   = {2024}
}

备注

Accepted at the 24th IEEE International Conference on Source Code Analysis and Manipulation(SCAM 2024) Research Track