微调大型语言模型对自动化程序修复的影响
软件工程
2025-07-29 v1 人工智能
计算与语言
机器学习
摘要
自动化程序修复(APR)使用各种工具和技术帮助开发者更快地实现功能完善且无错误的代码。近年来,大型语言模型(Large Language Models, LLMs)因其性能和灵活性而在 APR 工具链中获得了流行地位。然而,这些模型的训练需要大量资源。微调技术已开发用于将预训练的 LLMs 适应特定任务(如 APR),以比从头训练更低的计算成本提升性能。本研究探讨了 various 微调技术对用于 APR 的 LLMs 性能影响。我们的实验为在代码上预训练的若干最先进 LLMs(Codegen、CodeT5、StarCoder、DeepSeekCoder、Bloom 和 CodeLlama-2)提供了见解。评估基于三个流行的 APR 基准(QuixBugs、Defects4J 和 HumanEval-Java),并考虑六种不同参数规模的模型。我们考察三种训练方案:无微调、全参数微调和使用 LoRA 和 IA3 的参数高效微调(PEFT)。我们观察到,全参数微调技术因数据分布差异和过拟合导致各种模型的基准测试性能下降。通过使用参数高效微调方法,我们限制了可训练参数的数量,实现了更好的结果。
引用
@article{arxiv.2507.19909,
title = {The Impact of Fine-tuning Large Language Models on Automated Program Repair},
author = {Roman Macháček and Anastasiia Grishina and Max Hort and Leon Moonen},
journal= {arXiv preprint arXiv:2507.19909},
year = {2025}
}
备注
Accepted for publication in the research track of the 41th International Conference on Software Maintenance and Evolution (ICSME 2025)