大型语言模型在自动程序修复中的实证评估
软件工程
2025-06-17 v1
摘要
软件错误的日益普遍使自动程序修复(APR)成为关键研究焦点。大型语言模型(LLM)为APR提供了新机会,但现有研究大多依赖规模较小、较早一代的模型和Java基准。现代大规模LLM在多样语言和场景中的修复能力仍未被充分探索。为了解决这一问题,我们对四种开源LLM——CodeLlama、LLaMA、StarCoder和DeepSeek-Coder——进行了全面的实证研究,涵盖7B到33B参数、多样架构和用途。我们在两个错误场景(企业级和算法级)、三种语言(Java、C/C++、Python)和四种提示策略下进行评估,分析了六个基准上超过600K个生成的补丁。主要发现包括:(1)模型专业化(如CodeLlama)可以超越更大规模的通用模型(如LLaMA);(2)修复性能不随模型规模线性扩展;(3)正确补丁通常在生成早期出现;(4)提示显著影响结果。这些见解为设计有效且高效的基于LLM的APR系统提供了实践指导。
引用
@article{arxiv.2506.13186,
title = {Empirical Evaluation of Large Language Models in Automated Program Repair},
author = {Jiajun Sun and Fengjie Li and Xinzhu Qi and Hongyu Zhang and Jiajun Jiang},
journal= {arXiv preprint arXiv:2506.13186},
year = {2025}
}