中文

面向通用抓取的基于推理的大规模抓取 affordance 分割基准——RAGNet

计算机视觉与模式识别 2025-08-01 v1 机器人学

摘要

通用机器人抓取系统需要在遵循人类指令的多样化开放世界情境中实现准确的对象 affordance 感知。然而,当前研究因缺乏基于推理的大规模 affordance 预测数据而受限,这对开放世界效果提出了 considerable concern。为解决这一局限,我们构建了一个规模庞大的抓取导向 affordance 分割基准,命名为 RAGNet。它包含 273k 张图片、180 个类别和 26k 条推理指令。这些图片涵盖多样化的具身数据领域,如野生、机器人、第一人称甚至仿真数据。它们被仔细标注为 affordance 图,指令难度通过去除其类别名称仅提供功能描述而大幅增加。此外,我们提出了一个综合性的基于 affordance 的抓取框架,命名为 AffordanceNet,它由我们大规模 affordance 数据上预训练的 VLM 以及能够将 affordance 图条件化以抓取目标的抓取网络组成。在 affordance 分割基准和真实机器人操作任务上的大量实验表明,该模型具有强大的开放世界泛化能力。我们的数据和代码已在 https://github.com/wudongming97/AffordanceNet 上提供。

关键词

引用

@article{arxiv.2507.23734,
  title  = {RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping},
  author = {Dongming Wu and Yanping Fu and Saike Huang and Yingfei Liu and Fan Jia and Nian Liu and Feng Dai and Tiancai Wang and Rao Muhammad Anwer and Fahad Shahbaz Khan and Jianbing Shen},
  journal= {arXiv preprint arXiv:2507.23734},
  year   = {2025}
}

备注

Accepted by ICCV 2025. The code is at https://github.com/wudongming97/AffordanceNet