中文

IFG:面向功能抓取生成的互联网规模指引

机器人学 2025-11-13 v1 人工智能 计算机视觉与模式识别 图形学 机器学习

摘要

在互联网规模数据上进行训练的大规模视觉模型已在分割和语义理解物体部件方面展现出强大能力,甚至在杂乱、拥挤的场景中亦可做到。然而,这些模型仅能引导机器人指向物体的一般区域,却缺乏对灵巧机器人手部进行三维抓取精确控制所需的几何理解能力。为此,我们的关键洞察是利用仿真环境中的力闭抓取生成管线,该管线能够理解场景中手部与物体的局部几何结构。由于该管线计算缓慢且需要真实观测数据,故将其生成的数据蒸馏为可在相机点云上实时运行的扩散模型。通过将互联网规模模型的全局语义理解与仿真中基于局部几何的力闭几何精度相结合,\our 能够在无需任何人工收集训练数据的情况下实现高性能语义抓取。欲查看可视化效果,请访问我们的网站 https://ifgrasping.github.io/

关键词

引用

@article{arxiv.2511.09558,
  title  = {IFG: Internet-Scale Guidance for Functional Grasping Generation},
  author = {Ray Muxin Liu and Mingxuan Li and Kenneth Shaw and Deepak Pathak},
  journal= {arXiv preprint arXiv:2511.09558},
  year   = {2025}
}

备注

Website at https://ifgrasping.github.io/