中文

格关系Transformer:一种用于取物指令的跨模态语言生成模型

机器人学 2021-07-05 v1 计算与语言 计算机视觉与模式识别

摘要

机器人学中有许多研究致力于提升家用服务机器人的交流能力。然而,多数研究未能充分受益于深度神经网络的最新进展,因为训练数据集不够大。本文中,我们的目标基于跨模态语言生成模型扩充数据集。我们提出格关系Transformer(CRT),其从图像生成取物指令句子,例如“将蓝色人字拖移到左下角的盒子”。与现有方法不同,CRT使用Transformer整合图像中物体的视觉特征与几何特征。得益于格关系模块,CRT可处理物体。我们进行了对比实验与人工评估。实验结果表明CRT优于基线方法。

关键词

引用

@article{arxiv.2107.00789,
  title  = {Case Relation Transformer: A Crossmodal Language Generation Model for Fetching Instructions},
  author = {Motonari Kambara and Komei Sugiura},
  journal= {arXiv preprint arXiv:2107.00789},
  year   = {2021}
}

备注

Accepted for presentation at IROS2021