论 OpenAI o1 模型的规划能力:可行性、最优性与可泛化性
人工智能
2024-10-15 v4 机器学习
机器人学
摘要
近期大型语言模型 (LLM) 的进展展示了其执行复杂推理任务的能力,但在规划方面的有效性仍未得到充分探索。本研究评估了 OpenAI o1 模型在多种基准任务中的规划能力,重点关注可行性、最优性和可泛化性三个关键方面。通过在约束密集型任务 (如 Barman、Tyreworld) 和空间复杂环境 (如 Termes、Floortile) 中的经验评估,我们强调 o1-preview 在自我评估和约束遵循方面的优势,同时指出在决策和内存管理方面的瓶颈,特别是在需要稳健空间推理的任务中。我们的结果表明,o1-preview 在遵循任务约束和管理结构化环境中的状态转换方面优于 GPT-4。然而,该模型常生成次优解,包含冗余动作,且在空间复杂任务中难以有效泛化。本 pilot 研究为 LLM 的规划局限性提供了基础性见解,为改进 LLM 基于规划的记忆管理、决策和泛化提供了关键方向。代码可在 https://github.com/VITA-Group/o1-planning 获取。
引用
@article{arxiv.2409.19924,
title = {On The Planning Abilities of OpenAI's o1 Models: Feasibility, Optimality, and Generalizability},
author = {Kevin Wang and Junbo Li and Neel P. Bhatt and Yihan Xi and Qiang Liu and Ufuk Topcu and Zhangyang Wang},
journal= {arXiv preprint arXiv:2409.19924},
year = {2024}
}
备注
Code available at https://github.com/VITA-Group/o1-planning