MHPP:探索语言模型在基础代码生成之外的能力与局限
计算与语言
2025-08-19 v3
摘要
近期大型语言模型(LLM)的进展极大地提升了代码生成能力,尤其是在函数级别。例如,GPT-4o 在 HumanEval 上达到了 91.0% 的通过率。然而,这引发了人们对现有基准测试在全面评估函数级代码生成能力方面是否充分的质疑。我们的研究分析了两个常见基准测试 HumanEval 和 MBPP,发现由于质量、难度和粒度上的限制,这些测试可能无法全面评估 LLM 的代码生成能力。为解决这一问题,我们引入了“大部分困难Python问题”(MHPP)数据集,包含 210 个由人工精心设计的问题。通过聚焦自然语言与代码推理的结合,MHPP 衡量了 LLM 理解规范与约束、进行多步推理以及有效应用编码知识的能力。使用 MHPP 对 26 个 LLM 的初步评估显示,许多在 HumanEval 上表现优异的模型未能在 MHPP 上取得类似成功。此外,MHPP 揭示了各种 LLM 中此前未被发现的局限性,使我们相信它能为更好地理解 LLM 的能力与局限铺平道路。MHPP、评估流程和排行榜可在 https://github.com/SparksofAGI/MHPP 获取。
引用
@article{arxiv.2405.11430,
title = {MHPP: Exploring the Capabilities and Limitations of Language Models Beyond Basic Code Generation},
author = {Jianbo Dai and Jianqiao Lu and Yunlong Feng and Guangtao Zeng and Rongju Ruan and Ming Cheng and Dong Huang and Haochen Tan and Zhijiang Guo},
journal= {arXiv preprint arXiv:2405.11430},
year = {2025}
}
备注
43 pages, dataset and code are available at https://github.com/SparksofAGI/MHPP, leaderboard can be found at https://sparksofagi.github.io/MHPP/