语言模型可从环境反馈推断符号规划器的动作语义
人工智能
2024-11-11 v2 计算与语言
机器人学
摘要
符号规划器可在给定专家定义的、特定领域的逻辑动作语义后,从初始状态发现一序列动作以达到目标状态。大型语言模型(LLM)可直接生成此类序列,但由于推理和状态跟踪能力有限,常导致计划不足或不可执行。我们提出了预测动作语义的语言模型(Predicting Semantics of Actions with Language Models, PSALM),该方法自动学习动作语义,融合符号规划器和大型语言模型的优势。PSALM反复提议并执行计划,利用大型语言模型部分生成计划,并根据执行结果推断特定领域的动作语义。PSALM维持对可能动作语义的置信分布,并在达到目标状态前不断迭代更新。实验表明,在7个环境中,仅从一个目标学习,PSALM将计划成功率从Claude-3.5上的36.4%提升至100%,且比既有工作更高效地探索环境以推断真实的领域动作语义。
引用
@article{arxiv.2406.02791,
title = {Language Models can Infer Action Semantics for Symbolic Planners from Environment Feedback},
author = {Wang Zhu and Ishika Singh and Robin Jia and Jesse Thomason},
journal= {arXiv preprint arXiv:2406.02791},
year = {2024}
}