面向 LLM 代理训练的群内-群策略优化
机器学习
2025-10-29 v3 人工智能
摘要
最近的基于群体的强化学习(RL)进展推动了前沿大型语言模型(LLM)在单轮任务(如数学推理)方面的表现。然而,其在多轮 LLM 代理训练中的可扩展性仍有限。与静态任务不同,代理与环境之间的交互在多个步骤中进行,往往产生稀疏或延迟奖励,这使得在单个步骤之间进行信用分配要困难得多。在本工作中,我们提出了群内-群策略优化(GiGPO),这是一种新的 RL 算法,旨在为 LLM 代理实现细粒度的信用分配,同时保持群体-based RL 的有吸引力的属性:无评论家、低内存和稳定收敛。GiGPO 引入了两种层次结构来估计相对优势:(i)在剧集层面,GiGPO 基于完整轨迹组计算宏观相对优势;(ii)在步骤层面,GiGPO 引入了锚定状态分组机制,通过识别跨轨迹中重复的环境状态来反式构建步骤级别的组。来自相同状态的动作被分组,从而实现微观相对优势估计。这种层次结构有效地在不依赖辅助模型或额外 rollout 的情况下捕获全局轨迹质量和局部步骤效果。我们在具有挑战性的代理基准测试上评估了 GiGPO,包括 ALFWorld 和 WebShop,以及集成工具的推理,用于搜索增强的 QA 任务,采用 Qwen2.5-1.5B/3B/7B-Instruct。关键的是,GiGPO 提供了细粒度的逐步信用信号,在 ALFWorld 上实现超过 12% 的性能提升,在 WebShop 上实现超过 9% 的性能提升,并在 QA 任务中取得优异成绩(3B 模型为 42.1%,7B 模型为 47.2%),同时保持相同的 GPU 内存开销、相同的 LLM rollout 且几乎没有额外的时间成本。
引用
@article{arxiv.2505.10978,
title = {Group-in-Group Policy Optimization for LLM Agent Training},
author = {Lang Feng and Zhenghai Xue and Tingcong Liu and Bo An},
journal= {arXiv preprint arXiv:2505.10978},
year = {2025}
}
备注
NeurIPS 2025