中文

PDDL 能力在离线 LLM 中的广泛评估

人工智能 2025-02-28 v1 计算与语言

摘要

在近期进步中,大型语言模型(LLMs)在代码生成和链路思考推理方面表现出色,为解决自动形式规划任务奠定了基础。本研究评估了 LLMs 理解和生成规划域定义语言(PDDL)的潜力,后者是人工智能规划中essential 的表示。我们在20个不同模型上进行了广泛分析,涵盖7大主要 LLM 家族,包括商业和开源模型。我们的全面评估揭示了 LLMs 在零样本 PDDL 解析、生成和推理方面的能力。我们的发现表明,尽管某些模型在处理 PDDL 时显示出显著的效果,但其他模型在需要精细规划知识的更复杂情境中存在局限。这些结果凸显了 LLMs 在形式规划任务中的潜力和当前局限,为其应用和指导未来 AI 驱动规划范式的努力提供了见解。

关键词

引用

@article{arxiv.2502.20175,
  title  = {An Extensive Evaluation of PDDL Capabilities in off-the-shelf LLMs},
  author = {Kaustubh Vyas and Damien Graux and Sébastien Montella and Pavlos Vougiouklis and Ruofei Lai and Keshuang Li and Yang Ren and Jeff Z. Pan},
  journal= {arXiv preprint arXiv:2502.20175},
  year   = {2025}
}

备注

Under review