中文

面向长时程语言智能体的里程碑引导策略学习

计算与语言 2026-05-08 v1 人工智能

摘要

尽管长时程智能体任务需要语言智能体执行数十次顺序决策,但使用强化学习训练此类智能体仍具有挑战性。我们识别出两个根本原因:信用误归因,即正确的早期动作因终端失败而受到惩罚;以及样本效率低下,即稀缺的成功轨迹导致学习信号几乎完全丢失。我们引入一种里程碑引导的策略学习框架 BEACON,利用长时程任务的组合结构以确保精确的信用分配。BEACON 在里程碑边界处分割轨迹,对段内的部分进展应用时间奖励塑形,并在双尺度上估计优势,以防止远距离失败破坏局部动作评估。在 ALFWorld、WebShop 和 ScienceWorld 上,BEACON 均一致优于 GRPO 和 GiGPO。值得注意的是,在长时程 ALFWorld 任务上,BEACON 达到92.9%的成功率,几乎翻倍于 GRPO的53.5%,同时改善了有效样本利用率从23.7%提升至82.0%。这些结果确立了以里程碑为锚的信用分配作为训练长时程语言智能体的有效范式。代码已公开于 https://github.com/ZJU-REAL/BEACON。

关键词

引用

@article{arxiv.2605.06078,
  title  = {Milestone-Guided Policy Learning for Long-Horizon Language Agents},
  author = {Zixuan Wang and Yuchen Yan and Hongxing Li and Teng Pan and Dingming Li and Ruiqing Zhang and Weiming Lu and Jun Xiao and Yueting Zhuang and Yongliang Shen},
  journal= {arXiv preprint arXiv:2605.06078},
  year   = {2026}
}