教LLM规划:用于符号规划的逻辑思维链指令微调
人工智能
2025-09-18 v1 计算与语言
摘要
大型语言模型(LLM)在各种任务中展示了令人印象深刻的能力,然而它们执行结构化符号规划的能力仍然有限,特别是在需要形式化表示(如规划领域定义语言(PDDL))的领域。在本文中,我们提出了一种新颖的指令微调框架PDDL-Instruct,旨在通过逻辑思维链推理增强LLM的符号规划能力。我们的方法侧重于教导模型使用显式的逻辑推理步骤来严格推理动作的适用性、状态转换和规划有效性。通过开发指导模型完成确定动作在给定状态下何时可以应用所需的精确逻辑推理的指令提示,我们使LLM能够通过结构化反思自我纠正其规划过程。该框架通过将规划过程分解为关于前提条件满足、效果应用和不变量保持的显式推理链,系统地构建验证技能。在多个规划领域的实验结果表明,我们基于思维链推理的指令微调模型在规划方面显著更好,在标准基准上实现了高达94%的规划准确率,比基线模型绝对提高了66%。这项工作弥合了LLM的通用推理能力与自动规划所需的逻辑精度之间的差距,为开发更好的人工智能规划系统提供了一个有前景的方向。
引用
@article{arxiv.2509.13351,
title = {Teaching LLMs to Plan: Logical Chain-of-Thought Instruction Tuning for Symbolic Planning},
author = {Pulkit Verma and Ngoc La and Anthony Favier and Swaroop Mishra and Julie A. Shah},
journal= {arXiv preprint arXiv:2509.13351},
year = {2025}
}