可扩展的基于图的独立命名实体识别
信息检索
2018-11-27 v1
摘要
命名实体发现(NED)是一个重要的信息检索问题,可分解为两个子问题。第一个子问题,命名实体识别(NER),旨在当预定义词集中的词(称为“命名实体”:人名、地名、位置……)出现在自然语言中时对其进行标注。第二个子问题,命名实体链接/识别(NEL),将这些实体提及视为要在已有数据库中被识别的查询。在本文中,我们考虑NEL问题,并假设有一组必须在知识库中被识别的查询(或提及)。该知识库由一个文本数据库与一张语义图配对表示。我们介绍了NEL中的前沿方法,并提出一种用于命名实体独立识别的两步法。我们的方法深受近期深度学习方法缺乏可解释性、需要大量参数调优及海量标注数据等局限性的启发。首先,我们提出一种结合信息检索与文本挖掘技术设计的过滤算法,旨在最大化K处精度(通常5 <= K <= 20)。然后,我们引入两种基于图的命名实体识别方法,通过重排剩余顶部实体候选来最大化1处精度。第一种识别方法使用参数化图挖掘,第二种使用图核的相似性。我们的方法利用了来自标注网络数据的细粒度实体分类。我们详细给出算法,并在标准数据集(NIST TAC-KBP、CONLL/AIDA)上实验展示其精度性能优于任何已报道的基于图的方法,且与最先进系统相当。最后,我们总结了基于图的方法相较于近期深度学习方法的优势。
引用
@article{arxiv.1811.10547,
title = {Scalable graph-based individual named entity identification},
author = {Sammy Khalife and Michalis Vazirgiannis},
journal= {arXiv preprint arXiv:1811.10547},
year = {2018}
}