中文

基于轨迹图的长期智能体步骤级优势分配——SALT

机器学习 2025-10-24 v1

摘要

大型语言模型(LLM)已展示出惊人的能力,使语言智能体在单轮任务中表现出色。然而,其应用于复杂、多步骤和长期任务仍具有挑战性。尽管强化学习(RL)为解决这些问题提供了可行的途径,但主流方法通常仅依赖稀疏、结果导向的奖励,这在缺乏评论模型的群体基于RL算法(如Group Relative Policy Optimization, GRPO)中尤其成问题。在此类方法中,对轨迹中所有动作统一奖励或惩罚可能导致训练不稳定和次优策略,因为有益和有害动作常在多步骤交互中交织在一起。在本工作中,我们提出了SALT,这是一个新型轻量级框架,提供源自结果奖励的更细粒度的优势分配。我们通过从同一提示的轨迹构建图来实现这一点,这允许我们量化每一步的质量并相应分配优势。关键的是,SALT设计为可无缝集成到现有群体基于RL算法的插拨式模块,无需修改 rollout程序,引入的计算开销可忽略不计。在WebShop、ALFWorld和AppWorld基准测试中进行了广泛实验,各种模型规模均证明SALT一致改善了性能。我们还进行了彻底的分析,以验证SALT背后设计选择的合理性,并提供可操作的见解。

关键词

引用

@article{arxiv.2510.20022,
  title  = {SALT: Step-level Advantage Assignment for Long-horizon Agents via Trajectory Graph},
  author = {Jiazheng Li and Yawei Wang and David Yan and Yijun Tian and Zhichao Xu and Huan Song and Panpan Xu and Lin Lee Cheong},
  journal= {arXiv preprint arXiv:2510.20022},
  year   = {2025}
}