中文

Text2Grasp:基于物体抓取部位文本提示的抓取姿态生成

人工智能 2024-04-24 v1

摘要

手在人类抓取与操作物体的能力中发挥关键作用,可控的抓取合成是成功执行下游任务的关键。现有方法使用人类意图或任务级语言作为抓取的控制信号,本质上面临歧义问题。为应对这一挑战,我们提出了一种由物体抓取部位文本提示引导的抓取合成方法 Text2Grasp,以提供更精确的控制。具体而言,我们提出了一种两阶段方法,包含一个文本引导的扩散模型 TextGraspDiff,首先生成粗略的抓取姿态,随后应用手-物接触优化过程以确保合理性与多样性。此外,通过利用大语言模型,我们的方法支持由任务级和个性化文本描述引导的抓取合成,且无需额外的人工标注。大量实验表明,我们的方法不仅实现了准确的部位级抓取控制,还在抓取质量上取得了可比的性能。

关键词

引用

@article{arxiv.2404.15189,
  title  = {Text2Grasp: Grasp synthesis by text prompts of object grasping parts},
  author = {Xiaoyun Chang and Yi Sun},
  journal= {arXiv preprint arXiv:2404.15189},
  year   = {2024}
}