通过推理迁移与LLM引导强化学习提升开源LLM的程序修复能力
软件工程
2025-06-05 v1
摘要
多个闭源LLM在程序修复任务中持续优于开源替代方案,主要归因于其优越的推理能力和广泛的预训练。本文引入Repairity,一种新颖的三阶段方法,通过推理提取和强化学习显著缩小了这一性能差距。我们的方法:(1) 通过正确性验证系统性地从闭源模型中筛选高质量推理轨迹,(2) 通过监督微调将推理知识迁移至开源模型,(3) 开发基于LLM反馈的强化学习以进一步优化性能。在多个程序修复基准上的实证评估表明,Repairity将开源基础LLM Qwen2.5-Coder-32B-Instruct的平均性能提升了8.68%,将其与最先进闭源模型Claude-Sonnet3.7之间的能力差距从10.05%缩小至1.35%。消融研究证实,推理提取和LLM引导强化学习均对这些改进做出了显著贡献。我们的方法论可有效泛化至其他代码相关任务,使组织能够在保持开源模型固有可定制性、透明性和部署灵活性的同时,利用高质量的程序修复能力。
引用
@article{arxiv.2506.03921,
title = {Boosting Open-Source LLMs for Program Repair via Reasoning Transfer and LLM-Guided Reinforcement Learning},
author = {Xunzhu Tang and Jacques Klein and Tegawendé F. Bissyandé},
journal= {arXiv preprint arXiv:2506.03921},
year = {2025}
}