PythonSaga:重新定义评估代码生成大语言模型的基准
计算与语言
2024-07-08 v4 人工智能
摘要
受使用大语言模型(LLMs)进行代码生成的浪潮驱动,涌现出大量基准来评估这些LLM的能力。我们对HumanEval和MBPP这两个流行的Python代码生成基准进行了大规模人工评估,分析了它们的多样性和难度。我们的发现揭示了一个关键偏差:它们偏向于一组有限的编程概念,完全忽略了大多数其他概念。此外,我们揭示了一个令人担忧的普遍现象,即简单任务占主导,这可能夸大了模型性能的估计。为解决这些局限性,我们提出了一个新颖的基准PythonSaga,包含185个精心设计的提示,在38个编程概念上实现了均衡的代表性,并覆盖了不同的难度级别。现有代码LLM在该基准上的不佳表现证明了其稳健性。
引用
@article{arxiv.2401.03855,
title = {PythonSaga: Redefining the Benchmark to Evaluate Code Generating LLMs},
author = {Ankit Yadav and Himanshu Beniwal and Mayank Singh},
journal= {arXiv preprint arXiv:2401.03855},
year = {2024}
}