中文

面向克罗地亚新闻的基于选择性的关键词抽取

计算与语言 2018-02-15 v1 信息检索 社会与信息网络

摘要

本文是关于基于网络的克罗地亚语关键词抽取的初步报告,这是一种从复杂网络中进行无监督关键词抽取的方法。我们受基于图的中心性方法研究的启发,提出了一种新的网络度量——节点选择性(node selectivity),并以此构建我们的方法。节点选择性定义为单个节点连边上权重的平均分布。我们根据选择性值抽取节点(关键词候选),并进一步将抽取的节点扩展为按最高入/出选择性值排序的词元组(word-tuples)。基于选择性的抽取不需要语言学知识,它纯粹源自源文本中包含的统计和结构信息,这些信息反映在网络结构中。我们在人工标注的关键词上对所得集合进行了评估:对于抽取的关键词候选集,平均 F1 得分为 24.63%,平均 F2 得分为 21.19%;对于抽取的词元组候选集,平均 F1 得分为 25.9%,平均 F2 得分为 24.47%。

关键词

引用

@article{arxiv.1407.4723,
  title  = {Toward Selectivity Based Keyword Extraction for Croatian News},
  author = {Slobodan Beliga and Ana Meštrović and Sanda Martinčić-Ipšić},
  journal= {arXiv preprint arXiv:1407.4723},
  year   = {2018}
}