Card-660:剑桥罕见词数据集——一种用于低频词表示模型的可靠基准
计算与语言
2018-08-29 v1
摘要
由于对罕见词的有效处理在准确语义理解中可发挥关键作用,罕见词表示近来受到越来越多的关注。然而,用于评估和比较这些技术的可靠基准十分匮乏。我们在本文中表明,唯一现有的基准(斯坦福罕见词数据集)存在标注置信度低和词汇量有限的问题;因此,它并不构成一个可靠的比较框架。为填补这一评估空白,我们提出了 CAmbridge 罕见词数据集(Card-660),这是一个专家标注的词相似度数据集,为罕见词表示技术提供了一个高度可靠且具有挑战性的基准。通过一组实验,我们表明即使是最好的主流词嵌入(其词汇量达数百万词)在该数据集上的表现也无法超过 0.43(皮尔逊相关系数),而人类水平的上限为 0.90。我们在 https://pilehvar.github.io/card-660/ 发布了该数据集及标注材料。
引用
@article{arxiv.1808.09308,
title = {Card-660: Cambridge Rare Word Dataset - a Reliable Benchmark for Infrequent Word Representation Models},
author = {Mohammad Taher Pilehvar and Dimitri Kartsaklis and Victor Prokhorov and Nigel Collier},
journal= {arXiv preprint arXiv:1808.09308},
year = {2018}
}
备注
EMNLP 2018