Agent-RLVR:通过引导与环境奖励训练软件工程智能体
计算与语言
2025-06-24 v2 人工智能
摘要
从可验证奖励中学习强化学习已被广泛采用为增强大语言模型推理能力的默认方法,并在数学和竞赛编程等可验证领域取得了显著成功。然而,当应用于智能体环境时,RLVR 的有效性显著降低。这些设置以多步复杂问题求解为特征,导致即使是最前沿的大语言模型也面临高失败率,因为奖励景观过于稀疏,无法通过传统 RLVR 进行有效训练。在本工作中,我们提出了 Agent-RLVR,一个使 RLVR 在具有挑战性的智能体设置中有效的框架,首先聚焦于软件工程任务。借鉴人类教学法,Agent-RLVR 引入了智能体引导,一种通过利用多样化的信息线索积极引导智能体走向成功轨迹的机制。这些线索从高层战略计划到智能体错误和环境交互的动态反馈,模拟了教师的指导,使智能体能够导航困难的解空间,并通过额外的环境探索促进主动自我改进。在 Agent-RLVR 训练循环中,智能体首先尝试解决任务以产生初始轨迹,然后由单元测试验证并补充智能体引导。智能体随后在引导下重新尝试,智能体策略根据这些引导轨迹的奖励通过 RLVR 进行更新。Agent-RLVR 将 Qwen-2.5-72B-Instruct 在 SWE-Bench Verified 上的 pass@1 性能从 9.4% 提升至 22.4%。我们发现我们的引导增强 RLVR 数据对测试时奖励模型训练同样有用,进一步将 pass@1 提升至 27.8%。Agent-RLVR 为在传统 RL 方法难以应对的复杂真实世界环境中使用 RLVR 训练智能体奠定了基础。
引用
@article{arxiv.2506.11425,
title = {Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards},
author = {Jeff Da and Clinton Wang and Xiang Deng and Yuntao Ma and Nikhil Barhate and Sean Hendryx},
journal= {arXiv preprint arXiv:2506.11425},
year = {2025}
}