SeeUPO:具收敛性的序列级智能体 RL
人工智能
2026-02-09 v1
摘要
强化学习(RL)已成为训练大型语言模型(LLM)基于智能体的 AI 方法的主流范式,但现有的 backbone RL 算法在智能体情境下缺乏经过验证的收敛保证,尤其是在多轮情境下,可能导致训练不稳定和无法收敛至最优策略。本文系统分析了不同的政策更新机制和优势估计方法组合如何影响单/多轮情境下的收敛属性。我们发现 REINFORCE 与 Group Relative Advantage Estimation(GRAE)可在无折扣条件下收敛至全局最优,但 PPO 与 GRAE 的组合会破坏 PPO 原始的单调改进属性。进一步,我们表明主流的 backbone RL 算法无法在多轮情境下同时实现 critic-free 与收敛保证。为此,我们提出 SeeUPO(Sequence-level Sequential Update Policy Optimization),一种在多轮交互中具备收敛保证的 critic-free 方法。SeeUPO 将多轮交互建模为顺序执行的多智能体 bandit 问题。通过逆执行顺序的逐轮顺序政策更新,它确保单调改进并通过逆归纳收敛至全局最优解。在 AppWorld 和 BFCL v4 上的实验表明,SeeUPO 在 Qwen3-14B 上实现了 43.3%~54.6% 的显著性提升,在 Qwen2.5-14B 上实现了 24.1%~41.9% 的提升(平均跨基准),并在训练稳定性方面表现优于现有的 backbone 算法。
引用
@article{arxiv.2602.06554,
title = {SeeUPO: Sequence-Level Agentic-RL with Convergence Guarantees},
author = {Tianyi Hu and Qingxu Fu and Yanxi Chen and Zhaoyang Liu and Bolin Ding},
journal= {arXiv preprint arXiv:2602.06554},
year = {2026}
}