实体标注:在无提及监督下从文本中抽取实体
信息检索
2022-09-14 v1
摘要
文本中所有实体的检测与消歧对广泛应用而言是一项关键任务。该问题的典型形式化包含两阶段:检测提及边界并将所有提及链接到知识库。长期以来,提及检测一直被视为从文本中抽取所有实体的必要步骤,即使某些仅关注所抽取实体集合而忽略提及跨度信息的下游应用也是如此。在本文中,我们表明在此类情形下,检测提及边界在抽取实体方面不会带来任何显著的性能提升,因此可以被跳过。为开展分析,我们提出该问题的“实体标注”形式化,其中模型纯粹基于所抽取实体的集合进行评估而不考虑提及。我们将最先进的提及感知实体链接方案与 GET(一个提及不可知的序列到序列模型,给定输入上下文仅输出去歧义实体列表)进行比较。我们发现,这些模型在完全标注与部分标注数据集上跨多个基准训练时均取得可比性能,表明 GET 无需显式提及边界监督即可以强劲性能抽取去歧义实体。
引用
@article{arxiv.2209.06148,
title = {Entity Tagging: Extracting Entities in Text Without Mention Supervision},
author = {Christina Du and Kashyap Popat and Louis Martin and Fabio Petroni},
journal= {arXiv preprint arXiv:2209.06148},
year = {2022}
}