中文

语言模型可从环境反馈推断符号规划器的动作语义

人工智能 2024-11-11 v2 计算与语言 机器人学

摘要

符号规划器可在给定专家定义的、特定领域的逻辑动作语义后,从初始状态发现一序列动作以达到目标状态。大型语言模型(LLM)可直接生成此类序列,但由于推理和状态跟踪能力有限,常导致计划不足或不可执行。我们提出了预测动作语义的语言模型(Predicting Semantics of Actions with Language Models, PSALM),该方法自动学习动作语义,融合符号规划器和大型语言模型的优势。PSALM反复提议并执行计划,利用大型语言模型部分生成计划,并根据执行结果推断特定领域的动作语义。PSALM维持对可能动作语义的置信分布,并在达到目标状态前不断迭代更新。实验表明,在7个环境中,仅从一个目标学习,PSALM将计划成功率从Claude-3.5上的36.4%提升至100%,且比既有工作更高效地探索环境以推断真实的领域动作语义。

关键词

引用

@article{arxiv.2406.02791,
  title  = {Language Models can Infer Action Semantics for Symbolic Planners from Environment Feedback},
  author = {Wang Zhu and Ishika Singh and Robin Jia and Jesse Thomason},
  journal= {arXiv preprint arXiv:2406.02791},
  year   = {2024}
}