中文

Planner-R1:奖励塑形使小语言模型实现高效的智能体强化学习

人工智能 2025-10-03 v2

摘要

我们在 TravelPlanner 基准上研究了使用大语言模型的智能体强化学习(Agentic RL)。我们的方法 Planner-R1 仅用 180 个训练查询就达到了 56.9% 的最终通过率,比 GPT-5 的 21.2% 基线提高了 2.7 倍,是公开排行榜上最强的智能体结果。一个核心发现是,较小的模型(8B)对奖励塑形高度响应:通过密集的过程级信号,它们达到了有竞争力的性能,同时比 32B 模型的计算效率高 3.5 倍,内存效率高 1.5 倍。较大的模型在稀疏奖励下更稳健,但从塑形中获得的相对增益较小,且运行间方差更高。虽然课程学习没有带来显著益处,但塑形奖励持续增强了学习动态,使 8B 模型成为智能体强化学习最高效的设置。至关重要的是,这些增益并非以过拟合为代价:微调后的模型在域外任务(包括 Multi-IF、NaturalPlan 和 τ-Bench)上大多保持或超过了基线性能。这些结果确立了奖励塑形是扩展智能体强化学习的决定性杠杆,突显了较小模型的竞争实力,并证明了可以在不牺牲泛化能力的情况下实现效率。

关键词

引用

@article{arxiv.2509.25779,
  title  = {Planner-R1: Reward Shaping Enables Efficient Agentic RL with Smaller LLMs},
  author = {Siyu Zhu and Yanbin Jiang and Hejian Sang and Shao Tang and Qingquan Song and Biao He and Rohit Jain and Zhipeng Wang and Alborz Geramifard},
  journal= {arXiv preprint arXiv:2509.25779},
  year   = {2025}
}