中文

用于集成任务与运动规划的基座化视觉语言解释器

机器人学 2025-11-05 v2 人工智能

摘要

尽管视觉语言模型的最新进展加速了语言引导机器人规划器的发展,但其黑箱性质往往缺乏实际部署所必需的安全保证和可解释性。相反,经典符号规划器提供严格的安全验证,但需要大量专家知识进行设置。为了弥合当前的差距,本文提出了ViLaIn-TAMP,一个用于实现可验证、可解释和自主机器人行为的混合规划框架。ViLaIn-TAMP包含三个主要组件:(1) 一个视觉语言解释器(ViLaIn),改编自先前工作,将多模态输入转换为结构化问题规范;(2) 一个模块化任务与运动规划(TAMP)系统,通过符号和几何约束推理将这些规范映射为可执行的轨迹序列;(3) 一个纠错规划(CP)模块,接收失败尝试的具体反馈,并将约束反馈给ViLaIn以细化规范。我们在烹饪领域设计了具有挑战性的操作任务并评估了框架。实验结果表明,ViLaIn-TAMP在平均成功率上比VLM-as-a-planner基线高出18%,而加入CP模块将平均成功率提升了32%。

关键词

引用

@article{arxiv.2506.03270,
  title  = {Grounded Vision-Language Interpreter for Integrated Task and Motion Planning},
  author = {Jeremy Siburian and Keisuke Shirai and Cristian C. Beltran-Hernandez and Masashi Hamaya and Michael Görner and Atsushi Hashimoto},
  journal= {arXiv preprint arXiv:2506.03270},
  year   = {2025}
}

备注

Project website: https://omron-sinicx.github.io/ViLaIn-TAMP/