中文

基于 Transformer 的维基百科列表中的主体实体检测

信息检索 2022-10-05 v1

摘要

在问答或文本摘要等任务中,具备关于相关实体的背景知识至关重要。在 DBpedia 或 CaLiGraph 等公开知识图谱中,关于实体——尤其是长尾或新兴实体——的信息远不完整。本文提出一种方法,利用列表(如枚举和表格)的半结构化特性来识别列表项(即条目和行)的主要实体。这些我们称之为主体实体的实体可用于提高知识图谱的覆盖率。我们的方法使用 transformer 网络在词元级别识别主体实体,在性能上超越已有方法且受限更少。由于灵活的输入格式,它适用于任意类型的列表,并且与先前工作不同,不依赖于作为输入提供的实体边界。我们通过对完整维基百科语料库应用该方法来展示我们的方法,提取了 4000 万条主体实体提及,估计精确率为 71%、召回率为 77%。结果已并入最新版本的 CaLiGraph。

关键词

引用

@article{arxiv.2210.01482,
  title  = {Transformer-based Subject Entity Detection in Wikipedia Listings},
  author = {Nicolas Heist and Heiko Paulheim},
  journal= {arXiv preprint arXiv:2210.01482},
  year   = {2022}
}

备注

Published at Deep Learning for Knowledge Graphs workshop (DL4KG) at International Semantic Web Conference 2022 (ISWC 2022)