SAGE:桥接语义与可操作部件以实现铰接物体的泛化性操作
机器人学
2024-04-02 v2 计算机视觉与模式识别
摘要
为了与结构和功能多样的日常铰接物体进行交互,理解物体部件在用户指令理解和任务执行中都起着核心作用。然而,部件的语义含义与物理功能之间可能存在不一致,这为设计通用系统带来了挑战。为了解决这个问题,我们提出了 SAGE,一个新颖的框架,它桥接了铰接物体的语义部件和可操作部件,以在自然语言指令下实现泛化性操作。更具体地,给定一个铰接物体,我们首先观察其上的所有语义部件,指令解释器以此为条件提出具体化自然语言指令的可能动作程序。然后,部件定位模块将语义部件映射到所谓的泛化性可操作部件,这些部件本质上携带部件运动信息。在泛化性可操作部件上预测末端执行器轨迹,该轨迹与动作程序共同构成可执行策略。此外,还引入了一个交互式反馈模块以响应失败,从而闭合回路并增强整个框架的鲁棒性。我们框架成功的关键在于大型视觉语言模型(VLM)与小型领域特定模型之间的联合提议与知识融合,以同时进行上下文理解和部件感知,前者提供一般直觉,后者作为专家事实。仿真和真实机器人实验均表明,我们在处理具有多种语言指令目标的大量铰接物体方面的有效性。
引用
@article{arxiv.2312.01307,
title = {SAGE: Bridging Semantic and Actionable Parts for GEneralizable Manipulation of Articulated Objects},
author = {Haoran Geng and Songlin Wei and Congyue Deng and Bokui Shen and He Wang and Leonidas Guibas},
journal= {arXiv preprint arXiv:2312.01307},
year = {2024}
}