中文

快慢结合的具身语言学习

计算与语言 2020-10-15 v4 人工智能

摘要

近期研究表明,基于大规模文本的神经网络语言模型经常规监督学习目标训练后,获得了令人惊讶的少样本与单样本学习倾向。本文中,我们展示一个置身于模拟三维世界、并具备新颖双编码外部记忆的具身智能体,在采用常规强化学习算法训练时可表现出类似的单样本词学习。在通过连续视觉感知与语言提示("这是一个dax")单次引入新物体后,该智能体能重新识别该物体并按指令操控它("把dax放在床上")。在此过程中,它无缝整合了情节内关于词"dax"恰当指称的短期知识,与跨情节获得的长期词汇与运动知识(即"床"与"放")。我们发现,在特定训练条件与特定记忆写入机制下,智能体的单样本词-物绑定可泛化至同一ShapeNet类别中的新样本,并在物体数量陌生的场景中有效。我们进一步展示双编码记忆如何被用作内在动机的信号,激励智能体为可能对后续执行指令有用的物体寻求名称。综上,结果表明深度神经网络可利用元学习、情景记忆与显式多模态环境来解释"快速映射"——人类认知发展的基本支柱,以及与人用户交互智能体的潜在变革性能力。

关键词

引用

@article{arxiv.2009.01719,
  title  = {Grounded Language Learning Fast and Slow},
  author = {Felix Hill and Olivier Tieleman and Tamara von Glehn and Nathaniel Wong and Hamza Merzic and Stephen Clark},
  journal= {arXiv preprint arXiv:2009.01719},
  year   = {2020}
}