中文

一种用于具身语言理解中系统性泛化的评测基准

计算与语言 2020-10-20 v2 人工智能 机器学习

摘要

人类能够轻松理解由熟悉部分组合而成、描述陌生情境的表达("在摩天轮旁问候粉色雷龙")。相比之下,现代神经网络难以解释新颖的组合。本文引入一个新的基准 gSCAN,用于评测具身语言理解中的组合泛化能力。相较于一个关注泛化句法方面的相关基准,gSCAN 定义了一种基于网格世界状态的语言,从而便于对习得具有语言学动机的规则进行新颖评估。例如,智能体必须理解诸如 'small' 等形容词如何相对于当前世界状态进行解释,或诸如 'cautiously' 等副词如何与新的动词组合。我们测试了一个强大的多模态基线模型和一个最先进的组合方法,发现当泛化需要系统性组合规则时,它们在大多数情况下都惨败。

关键词

引用

@article{arxiv.2003.05161,
  title  = {A Benchmark for Systematic Generalization in Grounded Language Understanding},
  author = {Laura Ruis and Jacob Andreas and Marco Baroni and Diane Bouchacourt and Brenden M. Lake},
  journal= {arXiv preprint arXiv:2003.05161},
  year   = {2020}
}

备注

accepted at NeurIPS 2020