中文

关于大语言模型的规划能力:一项批判性研究

人工智能 2023-11-27 v2

摘要

出于对基于通用网络语料训练的LLM中涌现推理能力的声称的好奇,本文着手调查其规划能力。我们旨在评估(1)LLM在常识规划任务中自主生成计划的有效性,以及(2)LLM在LLM-Modulo设定中作为外部规划器与验证器的启发式引导来源的潜力。我们通过在国际规划竞赛所用类似领域上生成一组实例并进行系统研究,在自主与启发式两种不同模式下评估LLM。我们的发现揭示,LLM自主生成可执行计划的能力相当有限,最佳模型(GPT-4)在各领域平均成功率约12%。然而,LLM-Modulo设定的结果更具前景。在LLM-Modulo设定中,我们证明LLM生成的计划可改善底层可靠规划器的搜索过程,并进一步展示外部验证器能够帮助对生成计划提供反馈并反向提示LLM以生成更好计划。

关键词

引用

@article{arxiv.2305.15771,
  title  = {On the Planning Abilities of Large Language Models : A Critical Investigation},
  author = {Karthik Valmeekam and Matthew Marquez and Sarath Sreedharan and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:2305.15771},
  year   = {2023}
}

备注

NeurIPS 2023 Spotlight. arXiv admin note: substantial text overlap with arXiv:2206.10498