超越轨迹级归因:基于图的智能体强化学习信用分配
机器学习
2026-05-27 v1 人工智能
摘要
基于群体的强化学习(RL)方法在提高大型语言模型(LLM)性能方面取得了显著成功,并已快速扩展到智能体任务。然而,这些方法的信用分配严重依赖于基于最终结果的粗粒度轨迹级归因,难以捕捉单个步骤的贡献,例如被失败轨迹中掩盖的有价值步骤。为揭示潜在信息并实现更可靠的步骤级信用分配,我们提出基于图的群体政策优化(GraphGPO),该方法首先将所有 rollout 轨迹聚合到统一的状态转换图中,然后估计每个状态到任务目标的距离。最后,GraphGPO 基于转换如何减少到任务目标的距离来估计图基优势,从而为每条边分配信用。如此一来,GraphGPO 显著提高了训练效率,并在一系列具有挑战性的基准测试中实现了最新状态(SOTA)性能。
引用
@article{arxiv.2605.26684,
title = {Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning},
author = {Xin Cheng and Shuo He and Lang Feng and HaiYang Xu and Ming Yan and Lei Feng and Bo An},
journal= {arXiv preprint arXiv:2605.26684},
year = {2026}
}
备注
Accepted by ICML 2026