中文

面向视觉接地语言习得的类比推理

计算与语言 2020-07-24 v1 人工智能 计算机视觉与模式识别 机器人学

摘要

儿童通过观察周围世界并聆听描述,在潜意识中习得语言。即使没有显式的语言知识,他们也能发现词的含义,并轻松泛化到新颖组合。在本文中,我们将这一能力引入 AI,研究视觉接地语言习得(VLA)任务。我们提出一种增强以新颖类比推理机制的多模态 transformer 模型,该机制通过从已见组合中学习语义映射与推理操作来近似新颖组合。我们提出的方法,类比推理 Transformer 网络(ARTNet),在原始多媒体数据(视频帧与转录文本)上训练;在观察到一组如“洗苹果”或“切胡萝卜”的组合后,它能泛化并识别新视频帧中的新组合,如“洗胡萝卜”或“切苹果”。为此,ARTNet 参考训练数据中的相关实例,利用其视觉特征与字幕与查询图像建立类比,然后选择恰当的动词与名词来创建最佳描述新图像的新组合。在 instructional video 数据集上的大量实验表明,与最先进的 transformer 模型相比,所提方法取得了显著更好的泛化能力与识别准确率。

关键词

引用

@article{arxiv.2007.11668,
  title  = {Analogical Reasoning for Visually Grounded Language Acquisition},
  author = {Bo Wu and Haoyu Qin and Alireza Zareian and Carl Vondrick and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:2007.11668},
  year   = {2020}
}

备注

12 pages