中文

基于部件可供性定位的 6 自由度细粒度抓取检测

机器人学 2025-05-01 v3 计算与语言 计算机视觉与模式识别 人机交互

摘要

机器人抓取是机器人与环境交互的基本能力。当前方法聚焦于如何在物体层面获得稳定可靠的抓取姿态,而关于部件(形状)级抓取——其关联细粒度抓取与机器人可供性——的研究甚少。部件可视为构成物体的原子元素,包含丰富的语义知识并与可供性有强关联。然而,缺乏大规模部件级 3D 机器人数据集限制了部件表示学习及下游应用的发展。本文提出一个新的大规模语言引导形状抓取数据集(命名为 LangSHAPE),以促进 3D 部件级可供性与抓取能力学习。从机器人认知视角,我们设计了一个两阶段细粒度机器人抓取框架(命名为 LangPartGPD),包含一个新颖的 3D 部件语言定位模型与一个部件感知抓取姿态检测模型,其中来自人类或大型语言模型(LLMs)的显式语言输入可引导机器人生成带文本解释的部件级 6 自由度抓取姿态。我们的方法结合人机协作优势与 LLMs 的规划能力,使用显式语言作为符号中间体。为评估所提方法的有效性,我们在仿真与物理机器人设置下进行了 3D 部件定位与细粒度抓取检测实验,遵循不同文本复杂度的语言指令。结果表明我们的方法在 3D 几何细粒度定位、物体可供性推断与 3D 部件感知抓取任务上取得了有竞争力的性能。我们的数据集与代码发布于项目网站 https://sites.google.com/view/lang-shape

关键词

引用

@article{arxiv.2301.11564,
  title  = {Learning 6-DoF Fine-grained Grasp Detection Based on Part Affordance Grounding},
  author = {Yaoxian Song and Penglei Sun and Piaopiao Jin and Yi Ren and Yu Zheng and Zhixu Li and Xiaowen Chu and Yue Zhang and Tiefeng Li and Jason Gu},
  journal= {arXiv preprint arXiv:2301.11564},
  year   = {2025}
}

备注

15 pages, 8 figures, 7 tables