中文

Plan-and-Act:改进智能体长期任务规划

计算与语言 2025-08-05 v3

摘要

大语言模型(LLMs)在使语言智能体处理简单任务方面已取得显著进展。然而,将它们应用于复杂的多步骤长期任务仍然具有挑战性。近期研究发现,通过将高层规划与低层执行分离,可以取得成功,从而使模型能够有效平衡高层规划目标和低层执行细节。然而,生成准确的规划仍然困难,因为LLM本身并非为此任务而训练。为解决这一问题,我们提出了Plan-and-Act,一个将显式规划融入基于LLM的智能体的新框架,并引入了一种可扩展的方法,通过一种新颖的合成数据生成方法来增强规划生成。Plan-and-Act由一个规划模型和一个执行模型组成,前者生成结构化的高层规划以实现用户目标,后者将这些规划转化为环境特定的动作。为了有效训练规划模型,我们引入了一种合成数据生成方法,该方法用可行规划标注真实轨迹,并辅以多样且丰富的示例以增强泛化能力。我们在网页导航这一代表性长期规划环境中评估Plan-and-Act,在WebArena-Lite基准上展示了最先进的57.58%成功率,在WebVoyager上展示了纯文本最先进的81.36%成功率。

关键词

引用

@article{arxiv.2503.09572,
  title  = {Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks},
  author = {Lutfi Eren Erdogan and Nicholas Lee and Sehoon Kim and Suhong Moon and Hiroki Furuta and Gopala Anumanchipalli and Kurt Keutzer and Amir Gholami},
  journal= {arXiv preprint arXiv:2503.09572},
  year   = {2025}
}