中文

论 OpenAI o1 模型的规划能力:可行性、最优性与可泛化性

人工智能 2024-10-15 v4 机器学习 机器人学

摘要

近期大型语言模型 (LLM) 的进展展示了其执行复杂推理任务的能力,但在规划方面的有效性仍未得到充分探索。本研究评估了 OpenAI o1 模型在多种基准任务中的规划能力,重点关注可行性、最优性和可泛化性三个关键方面。通过在约束密集型任务 (如 Barman、Tyreworld) 和空间复杂环境 (如 Termes、Floortile) 中的经验评估,我们强调 o1-preview 在自我评估和约束遵循方面的优势,同时指出在决策和内存管理方面的瓶颈,特别是在需要稳健空间推理的任务中。我们的结果表明,o1-preview 在遵循任务约束和管理结构化环境中的状态转换方面优于 GPT-4。然而,该模型常生成次优解,包含冗余动作,且在空间复杂任务中难以有效泛化。本 pilot 研究为 LLM 的规划局限性提供了基础性见解,为改进 LLM 基于规划的记忆管理、决策和泛化提供了关键方向。代码可在 https://github.com/VITA-Group/o1-planning 获取。

关键词

引用

@article{arxiv.2409.19924,
  title  = {On The Planning Abilities of OpenAI's o1 Models: Feasibility, Optimality, and Generalizability},
  author = {Kevin Wang and Junbo Li and Neel P. Bhatt and Yihan Xi and Qiang Liu and Ufuk Topcu and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2409.19924},
  year   = {2024}
}

备注

Code available at https://github.com/VITA-Group/o1-planning