中文

SemGrasp:通过语言对齐离散化的语义抓取生成

计算机视觉与模式识别 2024-04-05 v1 人工智能

摘要

生成自然的人类抓取不仅需要考虑物体几何,还需要考虑语义信息。仅依赖物体形状进行抓取生成限制了先前方法在下游任务中的应用。本文提出一种新颖的基于语义的抓取生成方法,称为SemGrasp,它通过将语义信息融入抓取表示来生成静态的人类抓取姿态。我们引入一种离散表示,将抓取空间与语义空间对齐,从而能够根据语言指令生成抓取姿势。随后微调一个多模态大语言模型(MLLM),在统一的语义空间中整合物体、抓取和语言。为训练SemGrasp,我们编制了一个大规模、抓取-文本对齐的数据集CapGrasp,包含约26万条详细描述和5万种不同抓取。实验结果表明,SemGrasp能够高效生成与语言意图一致的自然人类抓取。我们的代码、模型和数据集公开于:https://kailinli.github.io/SemGrasp。

关键词

引用

@article{arxiv.2404.03590,
  title  = {SemGrasp: Semantic Grasp Generation via Language Aligned Discretization},
  author = {Kailin Li and Jingbo Wang and Lixin Yang and Cewu Lu and Bo Dai},
  journal= {arXiv preprint arXiv:2404.03590},
  year   = {2024}
}