基于实体档案生成的 Wikidata 实体链接候选检索改进方法
计算与语言
2022-03-16 v3
摘要
实体链接(EL)是将文档中的实体提及链接到知识库(KB)中对应实体的任务。以往许多研究聚焦于从维基百科衍生的知识库。尽管 Wikidata 是规模最大的众包知识库,但针对其上的实体链接工作很少。Wikidata 的规模可开启许多新的现实应用,但其海量实体数量也使实体链接颇具挑战。为有效缩小搜索空间,我们提出一种基于实体档案生成的新颖候选检索范式。首先将 Wikidata 实体及其文本字段索引至文本搜索引擎(如 Elasticsearch)。推理时,给定提及及其上下文,我们使用序列到序列(seq2seq)模型生成目标实体的档案,由其标题与描述组成。我们利用该档案查询已索引的搜索引擎以检索候选实体。我们的方法补充了使用维基百科锚文本字典的传统方法,使我们能进一步设计一种高效的混合候选检索方法。结合简单的交叉注意力重排序器,我们完整的实体链接框架在三个基于 Wikidata 的数据集上取得最先进结果,并在 TACKBP-2010 上表现强劲。
引用
@article{arxiv.2202.13404,
title = {Improving Candidate Retrieval with Entity Profile Generation for Wikidata Entity Linking},
author = {Tuan Manh Lai and Heng Ji and ChengXiang Zhai},
journal= {arXiv preprint arXiv:2202.13404},
year = {2022}
}
备注
ACL 2022 (Findings)