中文

Click to Grasp:基于视觉扩散描述符的零样本精确操作

机器人学 2024-12-30 v1 人工智能 计算机视觉与模式识别

摘要

跨场景和物体可泛化的精确操作仍然是机器人学中的一个持久挑战。当前处理此任务的方法严重依赖于拥有大量训练实例来处理具有显著视觉和/或几何部分模糊性的物体。我们的工作探索了利用基于网络的文本到图像扩散生成模型,在零样本设置下为精确操作建立细粒度部分描述符的 grounding。我们将该问题构建为一个密集语义部分对应任务。我们的模型返回一个用于操作特定部分的夹爪姿态,使用来自视觉上不同的同一物体实例的源图像中用户定义的点击作为参考。我们不需要人工抓取演示,因为我们利用了物体固有的几何形状和特征。在真实世界桌面场景中的实际实验验证了我们方法的有效性,展示了其在推进语义感知机器人操作方面的潜力。网页:https://tsagkas.github.io/click2grasp。

关键词

引用

@article{arxiv.2403.14526,
  title  = {Click to Grasp: Zero-Shot Precise Manipulation via Visual Diffusion Descriptors},
  author = {Nikolaos Tsagkas and Jack Rome and Subramanian Ramamoorthy and Oisin Mac Aodha and Chris Xiaoxuan Lu},
  journal= {arXiv preprint arXiv:2403.14526},
  year   = {2024}
}

备注

8 pages, 4 figures