中文

GLOVER:面向任务导向抓取的泛化开放词汇可供性推理

机器人学 2025-05-02 v2 计算机视觉与模式识别

摘要

基于人类指令推断任意物体的可供性(即可抓取性)部分,对于迈向开放词汇操作的机器人至关重要。然而,当前的抓取规划器受到有限的视觉-语言理解和耗时的 3D 辐射度建模的阻碍,限制了与物体的实时、开放词汇交互。为了解决这些局限性,我们提出了 GLOVER,一个统一的泛化开放词汇可供性推理框架,该框架微调大型语言模型(LLMs)以在 RGB 特征空间内预测可抓取物体部分的视觉可供性。我们编制了一个包含超过 10,000 张人类与物体交互图像的数据集,并标注了统一的视觉和语言可供性标签,以实现多模态微调。GLOVER 继承了 LLMs 的世界知识和常识推理,促进了更细粒度的物体理解和复杂的工具使用推理。为了实现有效的真实世界部署,我们提出了可供性感知抓取估计(AGE),这是一种非参数抓取规划器,它将夹爪姿态与从可供性数据导出的超二次曲面对齐。在 30 个桌面真实世界场景的评估中,GLOVER 在部件识别和抓取方面的成功率分别达到 86.0% 和 76.3%,其可供性推理速度比之前的 SOTA 快约 29 倍,抓取姿态估计速度快约 40 倍。我们还验证了其在不同具身间的泛化能力,展示了其在配备灵巧手的人形机器人上的有效性。

关键词

引用

@article{arxiv.2411.12286,
  title  = {GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping},
  author = {Teli Ma and Zifan Wang and Jiaming Zhou and Mengmeng Wang and Junwei Liang},
  journal= {arXiv preprint arXiv:2411.12286},
  year   = {2025}
}