中文

主题特定文本语料库中显著人物与组织的聚类

计算与语言 2019-07-09 v2

摘要

文本文档中的命名实体是文档中存在于现实世界的人、组织、地点或其他类型对象的名称。一个持续的研究挑战是利用计算技术在文本文档中识别此类实体。一旦识别,便可利用若干文本挖掘工具与算法来 leverage 这些发现的命名实体并改进 NLP 应用。本文提出一种基于文本语料库中语义相似性对显著人物与组织名称进行聚类的方法。该方法依赖于常见的命名实体识别技术与近期的词嵌入模型。利用词嵌入模型为命名实体生成的语义相似性分数对人物与组织类型的相似实体进行聚类。两位人工评判在由 4,821 篇特定主题文章组成的语料库上运行该方法后评估了方法的十种变体。方法的性能使用三种定量度量进行了测量。这三种度量的结果表明该方法在聚类语义相似命名实体方面是有效的。

关键词

引用

@article{arxiv.1807.10800,
  title  = {Clustering Prominent People and Organizations in Topic-Specific Text Corpora},
  author = {Abdulkareem Alsudais and Hovig Tchalian},
  journal= {arXiv preprint arXiv:1807.10800},
  year   = {2019}
}