通过视觉-语言模型实现经典任务规划器的落地 grounding
机器人学
2023-06-21 v3
摘要
经典规划系统已展现出利用基于规则的人类知识为服务机器人计算精确计划的巨大进步,但由于对完美感知与动作执行的强假设,它们面临挑战。为应对这些挑战,一种方案是将经典规划器生成的符号状态与动作连接到机器人的感官观测,从而闭合感知-动作回路。本研究提出一个名为 TPVQA 的视觉落地规划框架,其利用视觉-语言模型(VLMs)检测动作失败并验证动作可用性,以实现成功的计划执行。定量实验结果表明,TPVQA 在任务完成率上超越了以往研究的竞争性基线。
引用
@article{arxiv.2304.08587,
title = {Grounding Classical Task Planners via Vision-Language Models},
author = {Xiaohan Zhang and Yan Ding and Saeid Amiri and Hao Yang and Andy Kaminski and Chad Esselink and Shiqi Zhang},
journal= {arXiv preprint arXiv:2304.08587},
year = {2023}
}
备注
ICRA Workshop on Robot Execution Failures and Failure Management Strategies, 2023