利用门控奖励稳定长期多轮强化学习
机器学习
2025-08-15 v1 人工智能
计算与语言
摘要
奖励稀疏在长期强化学习 (RL) 任务中仍是一个重要挑战,而现有的基于结果的奖励塑形方法在定义有意义的即时奖励时容易引入偏差或需要显式的任务分解。另一方面,基于验证的奖励塑形使用逐步评估器,但即时奖励与长期目标之间的错位可能导致奖励作弊和次优策略。在本工作中,我们在软件工程 (SWE) 任务的背景下解决了这个问题,该任务中多轮推理和基于规则的验证至关重要。我们引入了面向 SWE 的强化学习框架,一个统一的系统,支持多轮交互、基于 Docker 的执行以及可定制的奖励函数。此外,我们提出了门控奖励累积 (G-RA),一种新方法仅在高层 (长期) 奖励满足预设阈值时才累积即时奖励,从而确保稳定的 RL 优化。在 SWE-bench Verified 和 kBench 上的实验表明,G-RA 使完成率提升 (47.6% → 93.8% 和 22.0% → 86.0%),修改率提升 (19.6% → 23.8% 和 12.0% → 42.0%),同时避免了由于奖励错位导致的策略退化。我们的发现突显了在长期 RL 中保持奖励累积平衡的重要性,并提供了实用的解决方案。
引用
@article{arxiv.2508.10548,
title = {Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards},
author = {Zetian Sun and Dongfang Li and Zhuoen Chen and Yuhuai Qin and Baotian Hu},
journal= {arXiv preprint arXiv:2508.10548},
year = {2025}
}