中文

用于无监督上下位词检测的分布包含向量嵌入

计算与语言 2018-05-31 v3

摘要

对上下位关系(例如 poodle is-a dog)进行建模,是许多自然语言处理(NLP)任务(如蕴含、共指、关系抽取和问答)的重要泛化辅助。从有标注的上下位词源(如 WordNet)进行监督学习限制了这些模型的覆盖范围,这一问题可以通过从无标注文本中学习上下位词来解决。现有的无监督方法要么无法扩展到大规模词汇表,要么准确率低得令人无法接受。本文提出了分布包含向量嵌入(DIVE),这是一种易于实现的无监督上下位词发现方法,通过逐词非负向量嵌入在低维且可解释的空间中保留词上下文的包含性质。在比我们所知的以往任何文献都更全面的实验评估中——在 11 个数据集上使用多种现有及新提出的评分函数进行评估——我们发现,使用一种紧凑得多的词表示,我们的方法提供了高达两倍于以往无监督嵌入的精确率,并取得了最高的平均性能,产生了许多新的 SOTA 结果。

关键词

引用

@article{arxiv.1710.00880,
  title  = {Distributional Inclusion Vector Embedding for Unsupervised Hypernymy Detection},
  author = {Haw-Shiuan Chang and ZiYun Wang and Luke Vilnis and Andrew McCallum},
  journal= {arXiv preprint arXiv:1710.00880},
  year   = {2018}
}

备注

NAACL 2018