中文

NATURAL PLAN: 基于自然语言的规划基准测试

计算与语言 2024-06-10 v1 人工智能

摘要

我们介绍了 NATURAL PLAN,这是一个包含 3 个关键任务的真实自然语言规划基准:行程规划、会议规划和日程安排。我们聚焦于评估大语言模型在完全了解任务情况下的规划能力,通过提供来自 Google Flights、Google Maps 和 Google Calendar 等工具的输出作为模型的上下文,从而消除对评估大语言模型规划能力所需的工具使用环境的需求。我们注意到 NATURAL PLAN 对当前最先进的模型来说是一个具有挑战性的基准。例如,在行程规划中,GPT-4 和 Gemini 1.5 Pro 的解答率分别为 31.1% 和 34.8%。我们发现,随着问题复杂度的增加,模型性能会急剧下降:当存在 10 个城市时,所有模型的性能均低于 5%,这凸显了在自然语言中进行规划方面存在显著的技术差距。我们还对 NATURAL PLAN 进行了大量消除实验,以进一步阐明诸如自我纠正、few-shot 泛化和利用长上下文进行情境规划等方法在提高大语言模型规划能力方面的(不)有效性。

关键词

引用

@article{arxiv.2406.04520,
  title  = {NATURAL PLAN: Benchmarking LLMs on Natural Language Planning},
  author = {Huaixiu Steven Zheng and Swaroop Mishra and Hugh Zhang and Xinyun Chen and Minmin Chen and Azade Nova and Le Hou and Heng-Tze Cheng and Quoc V. Le and Ed H. Chi and Denny Zhou},
  journal= {arXiv preprint arXiv:2406.04520},
  year   = {2024}
}