中文

用于命名实体消歧的基于聚类的提及类型判定

计算与语言 2023-06-22 v1

摘要

文本中的实体提及(如“Washington”)可能对应许多不同的命名实体,例如城市“Washington D.C.”或报纸“Washington Post.”。命名实体消歧的目标是从所有可能候选中正确识别出被提及的命名实体。如果能从上下文正确预测所提及实体的类型(例如地点或人物),则可通过为不太可能的候选分配低概率来提高选对候选的机会。本文提出用于命名实体消歧的基于聚类的提及类型判定。提及类型判定的目的是基于上下文预测给定提及的类型。通常使用人工整理的类型分类法,如维基百科类别。我们引入基于聚类的提及类型判定,其中命名实体根据其上下文相似性进行聚类,并将聚类id指定为类型。利用维基百科中的超链接提及及其上下文来获取这些基于聚类的类型。然后,在这些通过远程监督标注了基于聚类的类型的提及上训练提及类型判定模型。在命名实体消歧阶段,首先预测给定提及的基于聚类的类型,然后将这些类型用作排序模型中的特征,以从候选中选择最佳实体。我们在多个上下文层级上表示实体,并基于每个层级获得不同的聚类(以及相应的类型判定模型)。由于每种聚类以不同方式划分实体空间,基于每种聚类的提及类型判定对提及的区分也不同。当所有类型判定模型的预测一起使用时,我们的系统在四个事实标准测试集上基于随机化测试取得了优于或与最先进水平相当的结果。

关键词

引用

@article{arxiv.2109.11389,
  title  = {Cluster-based Mention Typing for Named Entity Disambiguation},
  author = {Arda Çelebi and Arzucan Özgür},
  journal= {arXiv preprint arXiv:2109.11389},
  year   = {2023}
}

备注

46 pages, 11 figures, 14 tables