中文

通过轮级重要性抽样与抢占触发归一化,稳定长期轨迹 LLM 代理的离策略训练

机器学习 2026-02-26 v2 人工智能 计算与语言

摘要

PPO 和 GRPO 等强化学习算法广泛用于训练大型语言模型(LLM)以执行多轮代理任务。然而,在离策略训练管道中,这些方法常表现出不稳定的优化动力学,容易引发性能崩溃。通过经验分析,我们识别出该setting下的两个根本性不稳定来源:(1)标记级策略优化与轮结构交互之间的粒度不匹配,(2)由离策略重要性抽样和不准确优势估计引发的高方差和不可靠的梯度更新。为此,我们提出了 SORL(Stabilizing Off-Policy Reinforcement Learning for Long-Horizon Agent Training),通过原则化机制使策略优化与多轮交互结构保持一致,并自适应抑制不可靠的离策略更新,从而实现更保守稳健的学习动力学。在此框架下,我们实现了两个稳定算法:SO-PPO 和 SO-GRPO。这两个算法旨在缓解梯度方差并防止优化崩溃,不需依赖谨慎的提前停止或经验性调参。我们在广泛的多轮搜索基准上评估了 SO-PPO 和 SO-GRPO,包括常规问答、多跳问答和医学多选问答任务。实验结果表明,这两种方法在标准 PPO 和 GRPO 中观察到的训练不稳定和性能崩溃现象始终被防止,保持更低的裁剪比率和更稳定的优化轨迹,并在任务性能上取得优异或相当的成绩。这些结果表明,所提出的算法为在多轮 LLM 代理训练中稳定强化学习提供了实用、可扩展且通用的框架。

关键词

引用

@article{arxiv.2511.20718,
  title  = {Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization},
  author = {Chenliang Li and Adel Elmahdy and Alex Boyd and Zhongruo Wang and Siliang Zeng and Alfredo Garcia and Parminder Bhatia and Taha Kass-Hout and Cao Xiao and Mingyi Hong},
  journal= {arXiv preprint arXiv:2511.20718},
  year   = {2026}
}