格关系Transformer:一种用于取物指令的跨模态语言生成模型
机器人学
2021-07-05 v1 计算与语言
计算机视觉与模式识别
摘要
机器人学中有许多研究致力于提升家用服务机器人的交流能力。然而,多数研究未能充分受益于深度神经网络的最新进展,因为训练数据集不够大。本文中,我们的目标基于跨模态语言生成模型扩充数据集。我们提出格关系Transformer(CRT),其从图像生成取物指令句子,例如“将蓝色人字拖移到左下角的盒子”。与现有方法不同,CRT使用Transformer整合图像中物体的视觉特征与几何特征。得益于格关系模块,CRT可处理物体。我们进行了对比实验与人工评估。实验结果表明CRT优于基线方法。
引用
@article{arxiv.2107.00789,
title = {Case Relation Transformer: A Crossmodal Language Generation Model for Fetching Instructions},
author = {Motonari Kambara and Komei Sugiura},
journal= {arXiv preprint arXiv:2107.00789},
year = {2021}
}
备注
Accepted for presentation at IROS2021