先学其法,后信其胜:面向智能体强化学习的渐进式探索自模仿
机器学习
2025-12-09 v4 人工智能
计算与语言
计算机视觉与模式识别
多智能体系统
摘要
强化学习(RL)是提升 LLM 在长周期、稀疏奖励智能体任务中战略性工具使用能力的主导范式,但它面临着探索与利用权衡的根本挑战。现有研究通过策略熵的视角来刺激探索,但这种机械的熵最大化容易因多轮分布偏移而导致 RL 的不稳定性。在本文中,我们旨在智能体自身经验的指导下实现渐进的探索与利用平衡,而不陷入熵塌缩或失控发散。我们提出了 SPEAR,一种用于训练智能体 LLM 的自模仿学习(SIL)方案。它扩展了原始的 SIL(即由回放缓冲区存储良好经验以进行离策略更新),通过在各个阶段逐步调整策略熵。具体而言,所提出的课程调度协调了内在奖励塑造和自模仿,以 1) 在开始时通过频繁的工具交互加速探索,以及 2) 在趋于熟悉环境收敛时加强对成功策略的利用。我们还结合了工业级 RL 优化的多种技巧,构建了强大的基线 Dr.BoT 以证明我们的有效性。在 ALFWorld 和 WebShop 中,SPEAR 分别将 GRPO/GiGPO/Dr.BoT 的成功率提高了高达 16.1%/5.1%/8.6% 和 20.7%/11.8%/13.9%。在 AIME24 和 AIME25 中,SPEAR 分别使 Dr.BoT 提升了高达 3.8% 和 6.1%。这些增益在实践中仅产生 10%-25% 的额外理论复杂性和可忽略的运行时开销,证明了 SPEAR 的即插即用可扩展性。
引用
@article{arxiv.2509.22601,
title = {Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning},
author = {Yulei Qin and Xiaoyu Tan and Zhengbao He and Gang Li and Haojia Lin and Zongyi Li and Zihan Xu and Yuchen Shi and Siqi Cai and Renting Rui and Shaofei Cai and Yuzheng Cai and Xuan Zhang and Sheng Ye and Ke Li and Xing Sun},
journal= {arXiv preprint arXiv:2509.22601},
year = {2025}
}
备注
45 pages, 14 figures