中文

Card-660:剑桥罕见词数据集——一种用于低频词表示模型的可靠基准

计算与语言 2018-08-29 v1

摘要

由于对罕见词的有效处理在准确语义理解中可发挥关键作用,罕见词表示近来受到越来越多的关注。然而,用于评估和比较这些技术的可靠基准十分匮乏。我们在本文中表明,唯一现有的基准(斯坦福罕见词数据集)存在标注置信度低和词汇量有限的问题;因此,它并不构成一个可靠的比较框架。为填补这一评估空白,我们提出了 CAmbridge 罕见词数据集(Card-660),这是一个专家标注的词相似度数据集,为罕见词表示技术提供了一个高度可靠且具有挑战性的基准。通过一组实验,我们表明即使是最好的主流词嵌入(其词汇量达数百万词)在该数据集上的表现也无法超过 0.43(皮尔逊相关系数),而人类水平的上限为 0.90。我们在 https://pilehvar.github.io/card-660/ 发布了该数据集及标注材料。

关键词

引用

@article{arxiv.1808.09308,
  title  = {Card-660: Cambridge Rare Word Dataset - a Reliable Benchmark for Infrequent Word Representation Models},
  author = {Mohammad Taher Pilehvar and Dimitri Kartsaklis and Victor Prokhorov and Nigel Collier},
  journal= {arXiv preprint arXiv:1808.09308},
  year   = {2018}
}

备注

EMNLP 2018