KITE:面向语义操控的关键点条件策略
机器人学
2023-10-13 v4 计算机视觉与模式识别
摘要
虽然自然语言为人类和机器人提供了便捷的共同接口,但使机器人能够理解并遵循语言指令仍是操控领域一个长期的挑战。实现高性能指令跟随机器人的一个关键步骤是达成语义操控,即机器人以不同具体程度解释语言,从“捡起毛绒动物”这类高层指令到“抓住大象的左耳”这类更细致的输入。为此,我们提出关键点+指令到执行(KITE),一种用于语义操控的两步框架,它同时关注场景语义(区分视觉场景中不同对象)与对象语义(在对象实例内精确局部化不同部件)。KITE首先通过2D图像关键点将输入指令锚定于视觉场景,为下游动作推断提供高精度的以对象为中心的偏置。给定RGB-D场景观测后,KITE执行学习到的关键点条件技能以完成指令。关键点与参数化技能相结合的精度实现了细粒度操控,并对场景与对象变化具有泛化能力。我们在三个真实环境中实证展示了KITE:长时序6-DoF桌面操控、语义抓取以及高精度咖啡制作任务。在这些设定中,KITE分别取得了75%、70%和71%的指令跟随总体成功率。KITE优于那些选择预训练视觉语言模型而非基于关键点的锚定、或舍弃技能而倾向端到端视觉运动控制的框架,且训练所用演示数量更少或相当。补充材料、数据集、代码和视频可在我们的网站查看:http://tinyurl.com/kite-site。
引用
@article{arxiv.2306.16605,
title = {KITE: Keypoint-Conditioned Policies for Semantic Manipulation},
author = {Priya Sundaresan and Suneel Belkhale and Dorsa Sadigh and Jeannette Bohg},
journal= {arXiv preprint arXiv:2306.16605},
year = {2023}
}