中文

CoPa:基于部件空间约束与基础模型的通用机器人操作框架

机器人学 2024-03-14 v1

摘要

在网页规模数据上预训练的基础模型已被证明封装了广泛的世界知识,能够以任务规划的形式惠及机器人操作。然而,这些规划的实际物理执行往往依赖于任务特定的学习方法,此类方法需要大量数据采集且泛化能力有限。本文提出一种新颖的框架——基于部件空间约束的机器人操作(CoPa),该框架利用嵌入在基础模型中的常识知识,为开放世界机器人操作生成一系列六自由度末端执行器位姿。具体而言,我们将操作过程分解为两个阶段:任务导向抓取与任务感知运动规划。在任务导向抓取阶段,我们采用基础视觉-语言模型(VLMs),通过一种新颖的由粗到精的定位机制来选择物体的抓取部件。在任务感知运动规划阶段,再次利用VLMs识别与任务相关的物体部件的空间几何约束,进而推导出抓取后的位姿。我们还展示了CoPa如何与现有机器人规划算法无缝集成,以完成复杂的长期任务。全面的真实世界实验表明,CoPa具备对场景的细粒度物理理解,能够以最少的提示工程且无需额外训练,处理开放集指令和物体。项目页面:https://copa-2024.github.io/

关键词

引用

@article{arxiv.2403.08248,
  title  = {CoPa: General Robotic Manipulation through Spatial Constraints of Parts with Foundation Models},
  author = {Haoxu Huang and Fanqi Lin and Yingdong Hu and Shengjie Wang and Yang Gao},
  journal= {arXiv preprint arXiv:2403.08248},
  year   = {2024}
}