中文

单视图场景点云人类抓取生成

计算机视觉与模式识别 2024-04-25 v1

摘要

本文探讨了一种基于单视图场景点云生成人类抓取的新任务,这更准确地反映了实际情境中仅从单个视角观察物体的情况。由于物体点云的不完整性以及大量场景点云的存在,生成的手掌容易穿透到物体不可见部分,而模型也容易受到场景点云的影响。因此,我们引入了 S2HGrasp 框架,包含两个关键模块:全局感知模块用于全局感知部分物体点云,以及 DiffuGrasp 模块用于基于包含场景点云的复杂输入生成高质量人类抓取。此外,我们引入了 S2HGD 数据集,包含约99,000个单对象单视图场景点云,涵盖1,668个唯一物体,每个物体都标注了一个人类抓取。我们的大量实验表明,S2HGrasp 不仅能生成不受场景点云影响的自然人类抓取,还能有效防止手掌与物体不可见部分之间的穿透。此外,我们的模型在应用于未见物体时展现出强大的泛化能力。我们的代码和数据集已提供:https://github.com/iSEE-Laboratory/S2HGrasp。

关键词

引用

@article{arxiv.2404.15815,
  title  = {Single-View Scene Point Cloud Human Grasp Generation},
  author = {Yan-Kang Wang and Chengyi Xing and Yi-Lin Wei and Xiao-Ming Wu and Wei-Shi Zheng},
  journal= {arXiv preprint arXiv:2404.15815},
  year   = {2024}
}