中文

面向LLM智能体层次化广义规划的策略分解学习与复用

人工智能 2026-05-11 v1

摘要

我们提出了一种动态策略学习方法,将广义规划和层次化任务分解相结合,用于基于LLM的智能体。我们的方法,即广义策略的层次化组件学习(HCL-GP),学习可跨任务实例泛化的参数化策略,并从成功的执行中自动提取可复用组件,将其组织成组件库以用于组合式策略生成。我们解决了三个挑战: 通过自动分解学习组件, 泛化组件以最大化复用,以及 通过语义搜索进行高效检索。在AppWorld基准上进行评估,我们的方法在正常任务上实现了98.2%的准确率,在具有未见应用挑战性任务上实现了97.8%的准确率,比挑战性场景下的静态合成提高了15.8个百分点。对于开源模型,动态复用实现了62.5%的成功率,而没有复用时成功率接近于零。这表明经典规划概念可以有效地与LLM智能体集成,以提高准确性和效率。

关键词

引用

@article{arxiv.2605.06957,
  title  = {Learning and Reusing Policy Decompositions for Hierarchical Generalized Planning with LLM Agents},
  author = {Shirin Sohrabi and Haritha Ananthakrishnan and Harsha Kokel and Kavitha Srinivas and Michael Katz},
  journal= {arXiv preprint arXiv:2605.06957},
  year   = {2026}
}