中文

LLM 与符号规划器相距多远?一种基于 NLP 的视角

人工智能 2025-08-05 v1

摘要

大型语言模型(LLMs)的推理和规划能力是近年来讨论的热门话题。它们能够将非结构化规划问题作为输入,使其在 AI 规划领域的集成成为一个关注的焦点。然而,LLM 作为规划器仍不可靠,生成的计划常常包含错误或幻觉动作。现有的基准测试和评估方法聚焦于使用 LLM 进行规划,主要以成功率作为各种规划任务(如验证计划或在放宽条件下进行规划)的质量指标。本文将 LLM 的规划视为一种自然语言处理(NLP)任务,鉴于 LLM 本身就是 NLP 模型。我们提出了一个恢复管道,包括对生成计划的 NLP 基于评估,以及三个阶段用于通过 NLP 操作生成的计划进行恢复,最终通过符号规划器完成计划。该管道为 AI 任务规划中 LLM 能力的整体分析提供了框架,使我们能够更广泛地理解无效计划的质量。我们的发现表明,在计划生成过程中没有明确的推理证据,恢复管道(包括对计划的 NLP 基于分析, followed by 恢复机制)仍不足以达到经典规划器的质量和可靠性。在平均情况下,只有前 2.65 个动作是可执行的,符号生成计划的平均长度为 8.4 个动作。该管道仍会提高动作质量,将整体成功率从 21.9% 提升到 27.5%。

关键词

引用

@article{arxiv.2508.01300,
  title  = {How Far Are LLMs from Symbolic Planners? An NLP-Based Perspective},
  author = {Ma'ayan Armony and Albert Meroño-Peñuela and Gerard Canal},
  journal= {arXiv preprint arXiv:2508.01300},
  year   = {2025}
}