中文

人类 vs. 木偶:GLUE基准上人类表现的保守估计

计算与语言 2019-06-04 v3 人工智能

摘要

GLUE基准(Wang et al., 2019b)是一套语言理解任务,在过去一年中取得了显著进展,平均表现从发布时的70.0提升至83.9,即撰写本文时(2019年5月24日)的最先进水平(SOTA)。在此,我们测量人类在该基准上的表现,以了解是否仍存在显著的提升空间。我们通过众包提供人类在该基准上表现的保守估计:我们的标注者是非专家,必须从一组简要说明和20个示例中学习任务。尽管训练有限,这些标注者在九项GLUE任务中的六项上稳健地优于最先进水平,并取得了87.1的平均分。然而,鉴于进展飞速,我们观测到的提升空间相当有限。为了复现标注者必须学习的贫数据设定,我们还在有限数据条件下训练了BERT模型(Devlin et al., 2019),并得出结论:低资源句子分类对于现代文本理解神经网络方法仍是一项挑战。

关键词

引用

@article{arxiv.1905.10425,
  title  = {Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark},
  author = {Nikita Nangia and Samuel R. Bowman},
  journal= {arXiv preprint arXiv:1905.10425},
  year   = {2019}
}