中文

面向物体摆放的自然语言指令的可微解析与视觉定位

机器人学 2023-03-14 v4 计算机视觉与模式识别 机器学习

摘要

我们提出一种新方法,PARsing And visual GrOuNding(ParaGon),用于在物体摆放任务中将自然语言定位。自然语言通常以组合性和歧义性描述物体与空间关系,这是有效语言定位的两大障碍。针对组合性,ParaGon 将语言指令解析为以物体为中心的图表示,以逐个定位物体。针对歧义性,ParaGon 使用一种新颖的基于粒子的图神经网络,在不确定性下推理物体摆放。本质上,ParaGon 将解析算法集成到概率的、数据驱动的学习框架中。它是完全可微的,并从数据中端到端训练,以对复杂、歧义的语言输入具有鲁棒性。

关键词

引用

@article{arxiv.2210.00215,
  title  = {Differentiable Parsing and Visual Grounding of Natural Language Instructions for Object Placement},
  author = {Zirui Zhao and Wee Sun Lee and David Hsu},
  journal= {arXiv preprint arXiv:2210.00215},
  year   = {2023}
}

备注

To appear in ICRA 2023