中文

CompGuessWhat?!:面向接地语言学习的多任务评估框架

计算与语言 2020-06-04 v1 人工智能 机器学习

摘要

接地语言学习(Grounded Language Learning)的方法通常聚焦于单一的基于任务的最终性能指标,而这些指标未必依赖于所学隐表示的合意性质,例如其预测显著属性的能力或向未见过情境的泛化能力。为此,我们提出GROLLA,一个带属性的接地语言学习评估框架,包含三个子任务:1)面向目标的评估;2)对象属性预测评估;3)零样本评估。我们还提出了新数据集CompGuessWhat?!作为该框架的一个实例,用于评估所学神经表示的质量,尤其是属性接地方面。为此,我们在感知层之上为原GuessWhat?!数据集添加了语义层。具体而言,我们用抽象与情境化属性丰富了与GuessWhat?!图像关联的VisualGenome场景图。通过诊断分类器,我们表明当前模型所学表示不足以编码对象属性(平均F1为44.27)。此外,它们未学到足以在涉及新场景或新对象的游戏玩法中表现良好的策略或表示(零样本最佳准确率50.06%)。

关键词

引用

@article{arxiv.2006.02174,
  title  = {CompGuessWhat?!: A Multi-task Evaluation Framework for Grounded Language Learning},
  author = {Alessandro Suglia and Ioannis Konstas and Andrea Vanzo and Emanuele Bastianelli and Desmond Elliott and Stella Frank and Oliver Lemon},
  journal= {arXiv preprint arXiv:2006.02174},
  year   = {2020}
}

备注

Accepted to the Annual Conference of the Association for Computational Linguistics (ACL) 2020