面向具身语言学习的多模态数据集的呈现与分析
机器人学
2020-09-29 v4 计算与语言
人机交互
摘要
具身语言习得——学习基于语言的交互如何指代周围世界——是机器人学、NLP 与 HCI 中的一大研究领域。实践中用于学习的数据几乎完全由文本描述构成,其往往比真实人类交互更干净、更清晰、更合乎语法。在这项工作中,我们呈现 Grounded Language Dataset(GoLD),一个由人们使用口语或书面语言描述的常见 household 物体的多模态数据集。我们分析了差异并呈现一项实验,展示不同模态如何影响来自人类输入的语习。这将使研究机器人学、NLP 与 HCI 交叉的学者能更好地探究图像、文本与语音的多模态如何交互,并展示这些模态的俗语差异如何影响结果。
引用
@article{arxiv.2007.14987,
title = {Presentation and Analysis of a Multimodal Dataset for Grounded Language Learning},
author = {Patrick Jenkins and Rishabh Sachdeva and Gaoussou Youssouf Kebe and Padraig Higgins and Kasra Darvish and Edward Raff and Don Engel and John Winder and Francis Ferraro and Cynthia Matuszek},
journal= {arXiv preprint arXiv:2007.14987},
year = {2020}
}
备注
11 pages, 6 figures