ClickDiff:基于扩散模型的用于可控抓取生成的点击诱导语义接触图
计算机视觉与模式识别
2024-07-30 v1
摘要
抓取生成旨在创建指定物体的复杂手-物体交互。虽然传统方法主要关注场景约束下的可见性和多样性,但往往忽视了手-物体细粒度交互(如接触),导致抓取不准确且不可取。为此,我们提出可控抓取生成任务,引入ClickDiff——一种可控条件生成模型,利用细粒度语义接触图(SCM)实现控制。该方法通过用户指定或算法预测的语义接触图,实现对抓取合成的精确控制。具体而言,为充分利用接触监督约束并准确建模手的复杂物理结构,我们提出了双生成框架。在此框架中,语义条件模块基于细粒度接触信息生成合理的接触图,而接触条件模块则将接触图与物体点云结合,用于生成真实可信的抓取。我们评估了适用于可控抓取生成的评估标准。在GRAB和ARCTIC数据集上的单手和双手生成实验验证了我们方法的有效性,证明了ClickDiff的有效性和鲁棒性,即使针对以前未见过的物体亦可。我们的代码已公开于https://github.com/adventurer-w/ClickDiff。
引用
@article{arxiv.2407.19370,
title = {ClickDiff: Click to Induce Semantic Contact Map for Controllable Grasp Generation with Diffusion Models},
author = {Peiming Li and Ziyi Wang and Mengyuan Liu and Hong Liu and Chen Chen},
journal= {arXiv preprint arXiv:2407.19370},
year = {2024}
}
备注
ACM Multimedia 2024