中文

基于视觉-语言输入的任务导向抓取预测

机器人学 2023-03-01 v1

摘要

为执行家庭任务,辅助机器人接收以用户语言指令形式给出的工具操作命令。初始阶段涉及选择目标工具(即目标定位)并以任务导向的方式抓取它(即任务定位)。然而,先前的视觉-语言抓取(VLG)研究集中于目标定位,而忽略了任务对物体抓取的细粒度影响。与任务不兼容的工具抓取将不可避免地限制后续操作步骤的成功。受此问题启发,本文提出了 GraspCLIP,在目标定位之外解决任务定位的挑战,以实现基于视觉-语言输入的任务导向抓取预测。在自定义数据集上的评估表明,GraspCLIP 的性能优于仅包含目标定位的现有基线。该方法的有效性进一步在辅助机械臂平台上得到验证,该平台在给定任务规范下抓取未见过的厨房工具。我们的演示视频见:https://www.youtube.com/watch?v=e1wfYQPeAXU。

关键词

引用

@article{arxiv.2302.14355,
  title  = {Task-Oriented Grasp Prediction with Visual-Language Inputs},
  author = {Chao Tang and Dehao Huang and Lingxiao Meng and Weiyu Liu and Hong Zhang},
  journal= {arXiv preprint arXiv:2302.14355},
  year   = {2023}
}

备注

8 pages, 8 figures, submitted to IROS 2023