中文

通过轮级奖励设计强化多轮推理中的大语言模型代理

机器学习 2025-10-24 v2

摘要

本文探讨了使用强化学习(Reinforcement Learning, RL)来增强大语言模型(Large Language Model, LLM)代理在长期、多轮情景下的推理能力。尽管强化学习算法如分组相对策略优化(Group Relative Policy Optimization, GRPO)和近端策略优化(Proximal Policy Optimization, PPO)已被广泛应用于训练多轮 LLM 代理,但它们通常仅依赖稀疏的结果奖励,缺乏跨多个决策步骤的稠密中间信号,限制了其在复杂推理任务中的性能。为弥合这一差距,我们首次系统性地研究了用于多轮 RL 算法和 agent 应用的轮级奖励设计。通过集成轮级奖励,我们将 GRPO 和 PPO 扩展为各自的多轮变体,实现了精细的信用分配。我们对多轮推理增强搜索 agent 进行案例研究,仔细设计了两种类型的轮级奖励:可验证奖励和 LLM 作为评判官。我们在多轮搜索任务上的实验表明,通过采用设计良好的轮级奖励,RL算法显著优于仅使用轨迹级奖励的基线方法。训练和验证奖励曲线显示,我们的方法实现了更好的稳定性、更快的收敛速度和更高的准确率。在多样化问答数据集上进一步的数值实验表明,我们的方法始终能够实现最高的答案正确性和 100% 的格式正确性。

关键词

引用

@article{arxiv.2505.11821,
  title  = {Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design},
  author = {Quan Wei and Siliang Zeng and Chenliang Li and William Brown and Oana Frunza and Wei Deng and Anderson Schneider and Yuriy Nevmyvaka and Yang Katie Zhao and Alfredo Garcia and Mingyi Hong},
  journal= {arXiv preprint arXiv:2505.11821},
  year   = {2025}
}

备注

work in progress