基于双编码与交叉注意力编码器的实体链接
计算与语言
2020-04-08 v1
摘要
实体链接有两个主要开放研究方向:1) 不使用别名表生成候选实体;2) 为提及和实体生成更具上下文的表示。最近,针对前者提出了一种解决方案,即双编码器实体检索系统(Gillick et al., 2019),该系统在同一空间中学习提及和实体的表示,并通过在该空间中选择离提及最近的实体来完成链接。在本工作中,我们仅使用该检索系统来生成候选实体。然后,我们通过目标提及与每个候选实体上的交叉注意力编码器对实体进行重排序。双编码器方法迫使所有信息都包含在用于表示提及和实体的小型固定向量维度集合中,而交叉注意力模型允许使用来自每个 <mention, context, candidate entity> 元组的详细信息(即特征)。我们在重排序器中实验了多种特征,包括融入文档级上下文的不同方式。我们在 TACKBP-2010 数据集上取得了最先进的结果,准确率为 92.05%。此外,我们展示了当在更大的 CoNLL-2003 数据集上训练并在 TACKBP-2010 上评估时,该重打分模型具有良好的泛化能力。
引用
@article{arxiv.2004.03555,
title = {Entity Linking via Dual and Cross-Attention Encoders},
author = {Oshin Agarwal and Daniel M. Bikel},
journal= {arXiv preprint arXiv:2004.03555},
year = {2020}
}