中文

Winograd风格任务中数据集重叠的分析

计算与语言 2020-11-16 v1 人工智能 机器学习

摘要

Winograd Schema Challenge(WSC)及其启发而来的变体已成为常识推理(CSR)的重要基准。基于大规模语料训练的神经语言模型,模型在WSC上的性能已迅速从随机水平提升至接近人类水平。在本文中,我们分析了这些训练语料与WSC风格任务中测试实例之间不同程度重叠的影响。我们发现大量测试实例与最先进模型(预)训练所用的语料有相当大的重叠,并且当我们对重叠最小的实例评估模型时,分类准确率出现显著下降。基于这些结果,我们开发了KnowRef-60K数据集,其包含从网络数据中爬取的超过6万个代词消歧问题。KnowRef-60K是迄今最大的WSC风格常识推理语料,并且与当前预训练语料的重叠比例显著更低。

关键词

引用

@article{arxiv.2011.04767,
  title  = {An Analysis of Dataset Overlap on Winograd-Style Tasks},
  author = {Ali Emami and Adam Trischler and Kaheer Suleman and Jackie Chi Kit Cheung},
  journal= {arXiv preprint arXiv:2011.04767},
  year   = {2020}
}

备注

11 pages with references, accepted at COLING 2020