NaturalCodeBench:考察 HumanEval 与自然用户提示上的编码性能失配
计算与语言
2024-05-08 v1 机器学习
软件工程
摘要
大型语言模型(LLM)在生成用于生产活动的代码方面展现了强大的能力。然而,当前的代码合成基准(如 HumanEval、MBPP 和 DS-1000)主要面向算法和数据科学方面的入门级任务,不足以满足现实编码中普遍存在的挑战性需求。为了填补这一空白,我们提出了 NaturalCodeBench(NCB),这是一个具有挑战性的代码基准,旨在反映真实编码任务的复杂性与场景多样性。NCB 包含 402 道高质量的 Python 和 Java 题目,精心筛选自在线编码服务中的自然用户查询,覆盖 6 个不同领域。鉴于为真实世界查询创建测试用例的极大难度,我们还引入了一条半自动化流水线以提高测试用例构建的效率。与人工解决方案相比,该流水线实现了 4 倍以上的效率提升。我们对 39 个 LLM 的系统实验发现,在 HumanEval 上得分相近的模型在 NCB 上的性能差距仍可能十分显著,这表明对实用代码合成场景的关注不足或对 HumanEval 存在过度优化。另一方面,即使是表现最好的 GPT-4 在 NCB 上也远未达到令人满意的水平。评估工具包和开发集可在 https://github.com/THUDM/NaturalCodeBench 获取。
引用
@article{arxiv.2405.04520,
title = {NaturalCodeBench: Examining Coding Performance Mismatch on HumanEval and Natural User Prompts},
author = {Shudan Zhang and Hanlin Zhao and Xiao Liu and Qinkai Zheng and Zehan Qi and Xiaotao Gu and Xiaohan Zhang and Yuxiao Dong and Jie Tang},
journal= {arXiv preprint arXiv:2405.04520},
year = {2024}
}