中文

用 APPS 基准衡量编程挑战能力

软件工程 2021-11-10 v3 计算与语言 机器学习

摘要

尽管编程是现代社会中最广泛适用的技能之一,现代机器学习模型仍无法为基本问题编写代码解决方案。尽管其重要性,关于代码生成评估的工作少得惊人,且难以严格准确评估代码生成性能。为应对这一挑战,我们引入 APPS,一个用于代码生成的基准。与先前在更受限环境下的工作不同,我们的基准衡量模型接受任意自然语言规范并生成令人满意的 Python 代码的能力。类似于公司评估候选软件开发人员的方式,我们通过检查模型在测试用例上生成的代码来评估模型。我们的基准包含 10,000 个问题,范围从简单的一行解决方案到实质性的算法挑战。我们在 GitHub 和我们的训练集上微调大语言模型,发现随着模型改进,语法错误的出现频率呈指数下降。近期模型如 GPT-Neo 能通过约 20% 的入门问题测试用例,因此我们发现机器学习模型正开始学习如何编程。随着未来几年自动代码生成的社会意义增加,我们的基准可提供追踪进展的重要度量。

关键词

引用

@article{arxiv.2105.09938,
  title  = {Measuring Coding Challenge Competence With APPS},
  author = {Dan Hendrycks and Steven Basart and Saurav Kadavath and Mantas Mazeika and Akul Arora and Ethan Guo and Collin Burns and Samir Puranik and Horace He and Dawn Song and Jacob Steinhardt},
  journal= {arXiv preprint arXiv:2105.09938},
  year   = {2021}
}

备注

NeurIPS 2021. Code and the APPS dataset is available at https://github.com/hendrycks/apps