应用于传记文本的命名实体识别工具比较
信息检索
2013-11-27 v1 计算与语言
摘要
命名实体识别(NER)是自然语言处理中的一个热门领域。因此,存在许多执行此任务的工具。除其他方面外,它们在所依赖的处理方法、可检测的实体类型、可处理的文本性质以及输入/输出格式上有所不同。这使得用户难以针对特定情况选择合适的 NER 工具。在本文中,我们试图在传记文本的背景下回答这个问题。为此,我们首先通过标注维基百科文章构建了一个新的语料库。然后,我们选择了一些公开可用、知名且免费用于研究的 NER 工具进行比较:Stanford NER、Illinois NET、OpenCalais NER WS 和 Alias-i LingPipe。我们将它们应用于我们的语料库,评估其性能并进行比较。在考虑整体性能时,出现了一个清晰的层级:Stanford 结果最佳,其次是 LingPipe、Illinois 和 OpenCalais。然而,相对于实体类型和文章类别进行的更详细评估突显了它们的性能受这些因素多样化影响的事实。这种互补性为组合这些独立工具以提高性能开辟了有趣的前景。
引用
@article{arxiv.1308.0661,
title = {A Comparison of Named Entity Recognition Tools Applied to Biographical Texts},
author = {Samet Atdağ and Vincent Labatut},
journal= {arXiv preprint arXiv:1308.0661},
year = {2013}
}