中文

长期 LLM 代理的 hindsight 信用分配

机器学习 2026-03-11 v1 人工智能

摘要

大型语言模型 (LLM) 代理在稀疏奖励的长程、多步骤任务中常面临显著的信用分配挑战。现有无价值方法,如群体相对策略优化 (GRPO),面临两个根本性瓶颈:对步骤级 Q 值估计不准确以及对中间状态的价值基线误对齐。为解决这些限制,我们引入 HCAPO,即首个将 hindsight 信用分配集成到 LLM 代理中的框架。HCAPO 利用 LLM 本身作为后见之明评论家,通过 hindsight 推理细化步骤级 Q 值。此外,HCAPO 的多尺度优势机制有效补充了关键决策状态下不准确的价值基线。跨越三个具有挑战性的基准测试(包括 WebShop 和 ALFWorld),评估表明 HCAPO 在所有方面均优于状态-of-the-art RL 方法。值得注意的是,HCAPO 在 WebShop 上实现了约 7.7% 的成功率提升,在 ALFWorld 上实现了约 13.8% 的提升,所使用的模型为 Qwen2.5-7B-Instruct。这些结果表明,HCAPO 显著提升了探索效率,促进了简洁决策,并在复杂长程任务中确保了可扩展性。

关键词

引用

@article{arxiv.2603.08754,
  title  = {Hindsight Credit Assignment for Long-Horizon LLM Agents},
  author = {Hui-Ze Tan and Xiao-Wen Yang and Hao Chen and Jie-Jing Shao and Yi Wen and Yuteng Shen and Weihong Luo and Xiku Du and Lan-Zhe Guo and Yu-Feng Li},
  journal= {arXiv preprint arXiv:2603.08754},
  year   = {2026}
}