中文

草莫田字段中的计划:评估和改进 LRM o1 的计划与调度能力

人工智能 2024-10-04 v1

摘要

计划一项行动以实现所需的状态一直被视为智能体的核心能力,是人工智能研究的组成部分。随着大语言模型 (LLM) 的出现,关于它们是否具备此类计划能力的争论日益引人关注,但尽管自 GPT3 以来涌现出大量新的私有和开源 LLM,其进展仍缓慢。OpenAI 声称其最新的 o1(Strawberry)模型被专为克服自回归 LLM 的常规局限性而构建和训练——成为一种新的模型类型:大规模推理模型 (LRM)。本文评估了两种 LRM(o1-preview 和 o1-mini)在规划和调度基准测试中的能力。我们发现虽然 o1 确实在自回归 LLM 方面提供了显著改进,但其代价高昂且仍无法对其生成内容提供任何保证。我们还展示了将 o1 模型与外部验证器结合——即所谓的 LRM-Modulo 系统——可保证组合系统输出的正确性,同时进一步提升性能。

关键词

引用

@article{arxiv.2410.02162,
  title  = {Planning in Strawberry Fields: Evaluating and Improving the Planning and Scheduling Capabilities of LRM o1},
  author = {Karthik Valmeekam and Kaya Stechly and Atharva Gundawar and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:2410.02162},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2409.13373