中文

SGL:混合模块化框架中用于遵循人类指令的符号目标学习

机器人学 2022-03-01 v1

摘要

本文研究基于含模糊请求的人类指令的机器人操作。其意图是通过视觉观测来弥补不完美自然语言的不足。早期的基于手动定义符号的符号方法构建了由语义解析与任务规划组成的模块化框架,以从自然语言请求生成动作序列。现代连接主义方法采用深度神经网络以端到端方式自动学习视觉与语言特征并映射到低级动作序列。这两种方法相融合以创建一种混合模块化框架:它将指令遵循表述为通过深度神经网络进行的符号目标学习,随后通过符号规划器进行任务规划。连接主义与符号模块通过规划领域定义语言桥接。视觉-语言学习网络预测其目标表示,并发送至规划器以生成完成任务动作序列。为提高自然语言灵活性,我们进一步将隐式人类意图与显式人类指令结合。为学习视觉与语言的通用特征,我们提出分别在场景图解析与语义文本相似度任务上预训练视觉与语言编码器。基准测试评估了视觉-语言学习模型不同组件或选项的影响,并展示了预训练策略的有效性。在模拟器AI2THOR中进行的操作实验显示了该框架对新场景的鲁棒性。

关键词

引用

@article{arxiv.2202.12912,
  title  = {SGL: Symbolic Goal Learning in a Hybrid, Modular Framework for Human Instruction Following},
  author = {Ruinian Xu and Hongyi Chen and Yunzhi Lin and Patricio A. Vela},
  journal= {arXiv preprint arXiv:2202.12912},
  year   = {2022}
}

备注

8 pages, 3 figures, 3 tables