SimLex-999:利用(真实)相似度估计评估语义模型
计算与语言
2014-08-18 v1
摘要
我们提出了 SimLex-999,这是一种用于评估分布语义模型的金标准资源,在几个重要方面改进了现有资源。首先,与 WordSim-353 和 MEN 等金标准不同,它明确量化相似度而非关联性或相关性,因此那些有关联但实际并不相似的实体对(如 [Freud, psychology])评分较低。我们表明,通过这种对相似度的关注,SimLex-999 激励开发具有不同且 arguably 更广泛应用范围的模型,而非那些反映概念关联的模型。其次,SimLex-999 包含一系列具体和抽象的形容词、名词和动词对,并为每对提供了独立的具体性评分和(自由)关联强度评分。这种多样性使得能够对模型在不同类型概念上的性能进行细粒度分析,从而更深入地了解如何改进架构。此外,不同于自动方法已达到或超过标注者间一致性上限的现有金标准评估,最先进模型在 SimLex-999 上的表现远低于此上限。因此,SimLex-999 有充足的空间来量化分布语义模型的未来改进,指导下一代表示学习架构的开发。
关键词
引用
@article{arxiv.1408.3456,
title = {SimLex-999: Evaluating Semantic Models with (Genuine) Similarity Estimation},
author = {Felix Hill and Roi Reichart and Anna Korhonen},
journal= {arXiv preprint arXiv:1408.3456},
year = {2014}
}