超越轨迹奖励:基于图建模的智能体搜索逐步信用分配
人工智能
2026-05-29 v1
摘要
在智能体搜索中,轨迹级结果奖励无法量化 individual steps 的行为贡献,而现有的逐步奖励方法通常依赖高成本的树形抽样。我们将世界知识视为潜在世界图,将每个任务视为潜在任务图内的搜索,其中有效的步骤应使图向答案节点推进。基于此,我们提出 Graph-Distance Contribution Reward(GDCR),这是一种用于评分新检索和新引用实体的逐步过程奖励,这些实体在训练时构建的实体-关系(ER)图中到答案节点的距离。我们进一步提出 Step Advantage Policy Optimization(SAPO),将 GDCR 转换为逐步优势,并将其与轨迹级结果优势相结合。在四个具有挑战性的基准测试上进行实验,验证了我们方法的有效性。
引用
@article{arxiv.2605.29697,
title = {Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling},
author = {Yuchen Liu and Yingjie Feng and Lixiong Qin and Jiasi Chen and Jianing Yu and Sheng Gao and Sheng Yang and Weiran Xu},
journal= {arXiv preprint arXiv:2605.29697},
year = {2026}
}
备注
15 pages, 8 figures