面向物体摆放的自然语言指令的可微解析与视觉定位
机器人学
2023-03-14 v4 计算机视觉与模式识别
机器学习
摘要
我们提出一种新方法,PARsing And visual GrOuNding(ParaGon),用于在物体摆放任务中将自然语言定位。自然语言通常以组合性和歧义性描述物体与空间关系,这是有效语言定位的两大障碍。针对组合性,ParaGon 将语言指令解析为以物体为中心的图表示,以逐个定位物体。针对歧义性,ParaGon 使用一种新颖的基于粒子的图神经网络,在不确定性下推理物体摆放。本质上,ParaGon 将解析算法集成到概率的、数据驱动的学习框架中。它是完全可微的,并从数据中端到端训练,以对复杂、歧义的语言输入具有鲁棒性。
引用
@article{arxiv.2210.00215,
title = {Differentiable Parsing and Visual Grounding of Natural Language Instructions for Object Placement},
author = {Zirui Zhao and Wee Sun Lee and David Hsu},
journal= {arXiv preprint arXiv:2210.00215},
year = {2023}
}
备注
To appear in ICRA 2023