中文

PSALM-V:利用大语言模型在交互式视觉环境中自动化符号规划

机器人学 2025-06-26 v1 计算与语言

摘要

我们提出了 PSALM-V,这是第一个能够通过交互在视觉环境中引导符号动作语义(即前置条件和后置条件)的自主神符号学习系统。PSALM-V 通过使用大语言模型生成启发式计划和候选符号语义,来自主引导可靠的符号规划,无需专家动作定义。以前的工作探索了使用大语言模型为基于 PDDL 的符号规划器生成动作语义的 methods。然而,这些方法主要关注文本-based 域,或依赖不现实的假设,如访问预定义问题文件、完全可观测性,或显式错误消息。相比之下,PSALM-V 通过分析执行结果和合成可能的错误解释,动态推断 PDDL 问题文件和域动作语义。该系统在保持动作每个动作可能语义的树状信念的同时,迭代生成和执行计划,直到达到目标状态。ALFRED 中的任务完成模拟实验表明,PSALM-V 在部分可观测设置下将计划成功率从 37%(Claude-3.7)提高到 74%。在两个 2D 游戏环境(RTFM 和 Overcooked-AI)上的结果显示,PSALM-V 在多智能体设置中提高了步骤效率并成功实现了域 induction。尽管机器人 BlocksWorld 任务中存在低层操作故障,PSALM-V 仍能正确诱导 PDDL 前置条件和后置条件。

关键词

引用

@article{arxiv.2506.20097,
  title  = {PSALM-V: Automating Symbolic Planning in Interactive Visual Environments with Large Language Models},
  author = {Wang Bill Zhu and Miaosen Chai and Ishika Singh and Robin Jia and Jesse Thomason},
  journal= {arXiv preprint arXiv:2506.20097},
  year   = {2025}
}