中文

关键词在局部向量空间中远离所有词的平均值

计算与语言 2020-08-24 v1

摘要

关键词抽取是一项重要的文档处理任务,旨在找到一小部分术语以简洁描述文档的主题。最流行的先进无监督方法属于图基方法家族,其构建词图并使用各种中心性度量对节点(候选关键词)打分。在本工作中,我们遵循不同路径,通过利用局部词向量表示对文档词的主分布建模,从文本文档中检测关键词。然后,我们根据候选词在文本中的位置以及相应局部向量与主分布中心之间的距离对候选词排序。通过一项扩展的实验研究,考察局部表示的性质,我们证实了相较于强基线和先进无监督关键词抽取方法,我们的方法具有高性能。

关键词

引用

@article{arxiv.2008.09513,
  title  = {Keywords lie far from the mean of all words in local vector space},
  author = {Eirini Papagiannopoulou and Grigorios Tsoumakas and Apostolos N. Papadopoulos},
  journal= {arXiv preprint arXiv:2008.09513},
  year   = {2020}
}