中文

利用名称列表从非结构化文档中识别金融机构命名实体

计算与语言 2016-06-08 v2

摘要

在文档集合中包含大量关于金融系统的信息。本文关注该领域的一个专门文本抽取任务。目标是从金融招股说明书文档中抽取金融机构名称(即FI名称)的提及,并识别对应的真实世界实体,例如通过与此类实体的语料库进行匹配。这些任务是命名实体识别(Named Entity Recognition, NER)和实体解析(Entity Resolution, ER);两者在文献中已被充分研究。我们的贡献是开发一种基于规则的方法,利用FI名称列表来完成这两项任务;我们的解决方案称为基于字典的NER(Dict-based NER)和基于排序的ER(Rank-based ER)。由于FI名称通常由词根和修改词根的后缀表示,我们使用这些FI名称列表来创建专门的词根和后缀字典。为了评估我们专门用于提取FI名称的解决方案的有效性,我们将基于字典的NER与通用基于规则的NER解决方案ORG NER进行比较。我们的评估突出了专用方法与通用方法的优点和局限性,并提出了用于FI名称提取的调优和定制的额外建议。据我们所知,我们提出的解决方案(基于字典的NER和基于排序的ER)以及词根和后缀字典,是首次尝试利用专门知识(即FI名称列表)进行基于规则的NER和ER。

关键词

引用

@article{arxiv.1602.04427,
  title  = {Exploiting Lists of Names for Named Entity Identification of Financial Institutions from Unstructured Documents},
  author = {Zheng Xu and Douglas Burdick and Louiqa Raschid},
  journal= {arXiv preprint arXiv:1602.04427},
  year   = {2016}
}