中文

带有增强步骤级转换的分层强化学习用于 LLM 智能体

人工智能 2026-04-16 v2 机器学习

摘要

大语言模型(LLM)智能体在复杂的交互式决策任务中展示了强大的能力。然而,现有的 LLM 智能体通常依赖越来越长的交互历史,导致高计算代价和有限的可扩展性。在本文中,我们提出了 STEP-HRL,一个分层强化学习(HRL)框架,通过仅基于单步转换而非完整交互历史来实现步骤级学习。STEP-HRL 以分层方式结构化任务,使用已完成的子任务来表示整体任务的全局进度。通过引入局部进度模块,它还在每个子任务内迭代且选择性地总结交互历史,以产生局部进度的紧凑摘要。这些组件共同为高策略和低策略提供了增强的步骤级转换。在 ScienceWorld 和 ALFWorld 基准上的实验结果一致表明,STEP-HRL 在性能和泛化方面大幅超越基线,同时减少了 token 使用量。我们的代码可在 https://github.com/TonyStark042/STEP-HRL 获取。

关键词

引用

@article{arxiv.2604.05808,
  title  = {Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents},
  author = {Shuai Zhen and Yanhua Yu and Ruopei Guo and Nan Cheng and Yang Deng},
  journal= {arXiv preprint arXiv:2604.05808},
  year   = {2026}
}

备注

Accepted to ACL 2026 Main Conference