中文

基于三维物体的语言 grounding

计算与语言 2021-09-16 v2 人工智能 计算机视觉与模式识别 机器学习 机器人学

摘要

人类对机器人看似简单的自然语言请求通常是欠规范的,例如“你能给我拿那个无线鼠标吗?”候选鼠标的平面图像可能无法提供“无线”所需的判别信息。世界及其中的物体并非平面图像,而是复杂的三维形状。若人类基于物体的任一基本属性(如颜色、形状或纹理)提出请求,机器人应执行必要的探索以完成任务。特别地,尽管在理解颜色、类别等显式视觉属性方面已付出大量努力并取得进展,但在理解关于形状与轮廓的语言方面进展相对较少。本文引入一种新颖的推理任务,面向关于三维物体的视觉与非视觉语言。我们提出的新基准 ShapeNet Annotated with Referring Expressions(SNARE)要求模型从两个物体中选出被自然语言描述所指代的那一个。我们引入若干基于 CLIP 的模型用于物体区分,并表明尽管近期视觉与语言联合建模的进展有助于机器人语言理解,但这些基于图像的模型在理解物体三维本质——在操控中起关键作用的性质——方面仍较弱。我们发现,为语言 grounding 模型添加视角估计可提升在 SNARE 及在机器人平台上识别语言所指物体的准确率,但同时指出这些模型与人类表现之间仍存在巨大差距。

关键词

引用

@article{arxiv.2107.12514,
  title  = {Language Grounding with 3D Objects},
  author = {Jesse Thomason and Mohit Shridhar and Yonatan Bisk and Chris Paxton and Luke Zettlemoyer},
  journal= {arXiv preprint arXiv:2107.12514},
  year   = {2021}
}

备注

Conference on Robot Learning (CoRL) 2021