LLM 智能体训练中的图增强策略优化
人工智能
2026-05-29 v2
摘要
交互环境中的多步 LLM 智能体是迈向长视野决策的关键一步。为了训练此类智能体,基于组的强化学习被广泛采用,它通过组内相对性能来强化轨迹。然而,在大多数现有方法中,轨迹中的每一步和具有相同终止奖励的每条轨迹都获得相同的贡献,无论其实际贡献如何。由于不同状态在从采样轨迹构建的在线状态转移图中扮演不同的结构角色,它们的影响应该在步骤和轨迹两个层面被区分并转化为任务感知的贡献。因此,我们提出了图增强策略优化(GEPO),一个用于多步 LLM 智能体训练中双层级结构贡献分配的框架。具体而言,GEPO 推导了一个状态级任务条件关键性分数,将状态转移图上的拓扑介数与任务提示的语义相似性相结合。基于此分数,通过状态自适应折扣重塑轨迹级贡献,而步骤级贡献则由其后继状态的关键性进行缩放。实验结果表明,GEPO 在 ALFWorld 上以 1.1% 的成功率超越了最强的基线,在 WebShop 上以 3.2%,在搜索增强 QA 任务的 7B 规模上平均以 3.8% 超越基线。与平坦的基于组的方法相比,GEPO 降低了跨种子方差,并将梯度信号集中在最关键的步骤上。
引用
@article{arxiv.2510.26270,
title = {Graph-Enhanced Policy Optimization in LLM Agent Training},
author = {Jiazhen Yuan and Zhike Gong and Jinquan Hang and Zhengbiao Bai and Wei Zhao},
journal= {arXiv preprint arXiv:2510.26270},
year = {2026}
}