大型语言模型遇见NL2Code:综述
软件工程
2023-05-09 v2 人工智能
计算与语言
编程语言
摘要
从自然语言描述生成代码的任务,即NL2Code,被认为是代码智能中一个紧迫且重大的挑战。得益于预训练技术的快速发展,涌现出大量针对代码的大型语言模型,推动了NL2Code的进步。为促进该领域的进一步研究和应用,本文对现有的27个用于NL2Code的大型语言模型进行了全面综述,并回顾了基准和评估指标。我们在HumanEval基准上对所有现有模型进行了直观比较。通过深入观察和分析,我们提供了一些见解,并得出结论:大型语言模型在NL2Code上取得成功的关键因素是“大规模、优质数据、专家调优”。此外,我们还讨论了模型与人类之间差距所带来的挑战与机遇。我们创建了一个网站https://nl2code.github.io,通过众包方式追踪最新进展。据我们所知,这是首个针对NL2Code的大型语言模型综述,我们相信它将为该领域的持续发展做出贡献。
引用
@article{arxiv.2212.09420,
title = {Large Language Models Meet NL2Code: A Survey},
author = {Daoguang Zan and Bei Chen and Fengji Zhang and Dianjie Lu and Bingchao Wu and Bei Guan and Yongji Wang and Jian-Guang Lou},
journal= {arXiv preprint arXiv:2212.09420},
year = {2023}
}
备注
Accepted to the main conference of ACL 2023 (long paper)