中文

最新GPT模型上的HumanEval——2024

计算与语言 2024-02-26 v1 人工智能 机器学习

摘要

2023年,我们使用GPT-4的最新模型来推进程序合成。大语言模型显著提升了这一领域的最新技术水平。为了使这些进展更易于获取,我们创建了一个将这些模型连接到HumanEval的仓库。该数据集最初是为了与名为CODEGEN的语言模型一起使用而开发的,涉及自然语言和编程语言数据。这些训练模型的实用性通过展示其在HumanEval任务上零样本Python代码生成中与先前最先进解决方案相比的竞争性能而得到体现。此外,这为开发更多多步范式合成开辟了道路。该基准测试包含160个多样化的问题集,分解为多步提示,我们的分析表明,这比单轮输入显著改善了程序合成。所有代码开源在https://github.com/daniel442li/gpt-human-eval。

关键词

引用

@article{arxiv.2402.14852,
  title  = {HumanEval on Latest GPT Models -- 2024},
  author = {Daniel Li and Lincoln Murr},
  journal= {arXiv preprint arXiv:2402.14852},
  year   = {2024}
}