A$^2$TGPO:具有自适应轮次级裁剪的智能体回合组策略优化
计算与语言
2026-05-08 v1
摘要
针对智能体大型语言模型的强化学习通常依赖于稀疏的轨迹级结果奖励,这使得评估多轮交互中单个工具调用的贡献变得困难。此类过程信用分配的现有方法要么依赖于引入额外消耗的独立外部过程奖励模型,要么依赖于基于树的结构化展开,这仅重新分配结果信号同时限制了轨迹多样性。一种有前景的替代方案是利用策略对真实标签预测概率的每轮变化(称为信息增益,IG)作为内在过程信号,而无需外部评估器。然而,先前在强化学习训练循环中利用 IG 信号的工作面临三个系统性挑战:在面临异构位置上下文的轮次间进行归一化会扭曲单个轮次的相对地位;累积可变数量的项会导致优势幅度随轨迹深度漂移;固定的裁剪范围对具有截然不同 IG 信号的轮次进行相同的策略更新控制。在本文中,我们提出了 ATGPO(具有自适应轮次级裁剪的智能体回合组策略优化),它保留了 IG 作为内在信号,但重新设计了其归一化、累积和消耗方式: 轮次组归一化:在每个(提示,轮次索引)组内对 IG 进行归一化,使得每个轮次仅与处于相同交互深度的对等轮次进行比较; 方差重缩放折扣累积:将累积归一化 IG 除以累积项的平方根,以保持优势幅度在不同轮次位置上具有可比性; 自适应轮次级裁剪:根据每个轮次的归一化 IG 调节其裁剪范围,为信息量大的轮次拓宽更新区域,并为信息量小的轮次收窄该区域。
引用
@article{arxiv.2605.06200,
title = {A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping},
author = {Dingwei Chen and Zefang Zong and Zhipeng Ma and Leo Luo and Yang Li and Chengming Li and Peng Chen and Jie Jiang},
journal= {arXiv preprint arXiv:2605.06200},
year = {2026}
}