PDDL 能力在离线 LLM 中的广泛评估
人工智能
2025-02-28 v1 计算与语言
摘要
在近期进步中,大型语言模型(LLMs)在代码生成和链路思考推理方面表现出色,为解决自动形式规划任务奠定了基础。本研究评估了 LLMs 理解和生成规划域定义语言(PDDL)的潜力,后者是人工智能规划中essential 的表示。我们在20个不同模型上进行了广泛分析,涵盖7大主要 LLM 家族,包括商业和开源模型。我们的全面评估揭示了 LLMs 在零样本 PDDL 解析、生成和推理方面的能力。我们的发现表明,尽管某些模型在处理 PDDL 时显示出显著的效果,但其他模型在需要精细规划知识的更复杂情境中存在局限。这些结果凸显了 LLMs 在形式规划任务中的潜力和当前局限,为其应用和指导未来 AI 驱动规划范式的努力提供了见解。
引用
@article{arxiv.2502.20175,
title = {An Extensive Evaluation of PDDL Capabilities in off-the-shelf LLMs},
author = {Kaustubh Vyas and Damien Graux and Sébastien Montella and Pavlos Vougiouklis and Ruofei Lai and Keshuang Li and Yang Ren and Jeff Z. Pan},
journal= {arXiv preprint arXiv:2502.20175},
year = {2025}
}
备注
Under review