中文

面向代码生成的大型语言模型综述

计算与语言 2025-10-28 v2 人工智能 软件工程

摘要

大型语言模型在多种与代码相关的任务中取得了显著进展,被称为代码大语言模型,特别是在代码生成方面,即利用大语言模型从自然语言描述生成源代码。这个新兴领域因其在软件开发中的实际意义(例如GitHub Copilot)而引起了学术界研究人员和行业专业人士的极大兴趣。尽管从自然语言处理或软件工程或两者的角度对大型语言模型在各种代码任务上的应用进行了积极探索,但明显缺乏一篇全面且最新的、专门针对代码生成的大型语言模型的文献综述。在本综述中,我们旨在通过提供一篇系统的文献综述来弥补这一空白,该综述可作为研究人员探究大型语言模型在代码生成领域前沿进展的宝贵参考。我们引入了一个分类法来分类和讨论大型语言模型在代码生成方面的最新进展,涵盖数据整理、最新进展、性能评估、伦理影响、环境影响和实际应用等方面。此外,我们回顾了用于代码生成的大型语言模型演变的历史,并使用HumanEval、MBPP和BigCodeBench基准测试,在不同难度级别和编程任务类型上进行了实证比较,以突出大型语言模型在代码生成能力上的逐步增强。我们指出了学术界与实际开发之间差距的关键挑战和潜在机遇。此外,我们建立了一个专门的资源GitHub页面,以持续记录和传播该领域的最新进展。

关键词

引用

@article{arxiv.2406.00515,
  title  = {A Survey on Large Language Models for Code Generation},
  author = {Juyong Jiang and Fan Wang and Jiasi Shen and Sungju Kim and Sunghun Kim},
  journal= {arXiv preprint arXiv:2406.00515},
  year   = {2025}
}