LLMs 仍无法规划;LRMs 可以吗?对 OpenAI o1 在 PlanBench 的初步评估
人工智能
2024-09-23 v1 计算与语言
摘要
规划一系列动作以实现预期状态的能力长期被视为智能体的核心能力,自 AI 诞生以来一直是该领域的重要研究部分。随着大语言模型 (LLM) 的出现,关于其是否具备此类规划能力的讨论日益关注。PlanBench 是一个可扩展的基准测试,于 2022 年在 GPT3 发布后不久即由我们开发,至今仍是评估 LLM 规划能力的重要工具。尽管自 GPT3 以来涌现出大量新的私有和开源 LLM,但在该基准测试上的进展却出乎意料地缓慢。OpenAI 声称其最新推出的 o1 (Strawberry) 模型是专为规避自回归 LLM 的常规局限性而构建和训练的,成为一种新的模型类型:大型推理模型 (LRM)。以此为催化剂,本文全面评估了当前 LLM 和新型 LRM 在 PlanBench 上的表现。正如我们将看到的,o1 在基准测试上的表现在质的飞跃,遥遥领先于其他模型,但仍远未饱和该基准。这种改进也引发了关于准确性、效率以及在部署此类系统前必须考虑的保证问题的讨论。
引用
@article{arxiv.2409.13373,
title = {LLMs Still Can't Plan; Can LRMs? A Preliminary Evaluation of OpenAI's o1 on PlanBench},
author = {Karthik Valmeekam and Kaya Stechly and Subbarao Kambhampati},
journal= {arXiv preprint arXiv:2409.13373},
year = {2024}
}