面向现实代码修复的智能强化学习
机器学习
2025-10-28 v1 人工智能
计算与语言
摘要
我们解决在真实代码仓库中训练可靠代码修复智能体的挑战,在其中复杂的构建和不断变化的依赖关系使得评估不稳定。我们开发了一个可验证的管道,其中成功被定义为修复后的构建验证和通过约1K个真实问题提升了可重复性,通过固定依赖项和禁用自动升级实现。建立在此基础上,我们引入了一个用于大规模强化学习 (RL) 的可扩展简化管道。在此设置下,我们监督微调 Qwen3-32B 进行完整管道训练,并在简化环境中对 SFT 模型进行 RL。来自 GPT-4.1 轨迹的 SFT 模型性能相当且规模缩小了 56 倍,RL 带来了在匹配的训练-测试条件下 7-20% 的绝对提升。实验中发现,“思考模式”表现与或略差。两种 SFT 和 RL 模型在跨环境泛化方面都失败了,这凸显了在构建可靠的现实代码修复智能体方面,匹配训练-测试环境的重要性。
引用
@article{arxiv.2510.22075,
title = {Agentic Reinforcement Learning for Real-World Code Repair},
author = {Siyu Zhu and Anastasiya Karpovich and Albert Chen and Jessica Koscheka and Shailesh Jannu and Di Wen and Yuqing Zhu and Rohit Jain and Alborz Geramifard},
journal= {arXiv preprint arXiv:2510.22075},
year = {2025}
}