基于稠密实体检索的可扩展零样本实体链接
计算与语言
2020-09-30 v3
摘要
本文提出了一种概念简单、可扩展且高效的基于 BERT 的实体链接模型,并就其准确率-速度权衡进行了广泛评估。我们提出了一种两阶段零样本链接算法,其中每个实体仅由一段简短的文本描述定义。第一阶段在由双编码器定义的稠密空间中进行检索,该编码器独立嵌入提及上下文与实体描述。随后使用交叉编码器对每个候选进行重排序,该编码器将提及与实体文本拼接。实验表明,尽管方法相对简单(例如无显式实体嵌入或人工设计的提及表),该方法在近期零样本基准上达到了最优水平(绝对提升 6 个百分点),在更成熟的非零样本评测(如 TACKBP-2010)上同样如此。我们还展示了双编码器链接在最近邻搜索下非常快(例如在 2 毫秒内对 590 万候选进行链接),并且更昂贵的交叉编码器的多数准确率增益可通过知识蒸馏迁移到双编码器。我们的代码与模型见 https://github.com/facebookresearch/BLINK。
引用
@article{arxiv.1911.03814,
title = {Scalable Zero-shot Entity Linking with Dense Entity Retrieval},
author = {Ledell Wu and Fabio Petroni and Martin Josifoski and Sebastian Riedel and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:1911.03814},
year = {2020}
}
备注
accepted at EMNLP 2020