面向领域无关实体链接的细粒度实体类型标注
计算与语言
2020-01-09 v2 人工智能
机器学习
摘要
神经实体链接模型非常强大,但存在过拟合到其所训练领域的风险。对于此问题,一个领域不仅由文本体裁刻画,甚至由诸如实体特定分布这类因素刻画,因为神经模型往往通过记忆数据集中高频实体的属性而过拟合。我们解决构建鲁棒实体链接模型的问题,此类模型能有效泛化且不依赖具有特定实体分布的标注实体链接数据。我们的方法不直接预测实体,而是建模细粒度实体属性,这有助于即使在紧密相关的实体之间消歧。我们从维基百科类别中导出大量类型(数万种),并使用维基百科中的超链接提及进行远程标注数据并训练实体类型标注模型。在测试时,我们用该类型标注模型对提及分类,并使用软类型预测将提及链接到最相似的候选实体。我们在CoNLL-YAGO数据集(Hoffart et al., 2011)上评估我们的实体链接系统,并展示我们的方法优于先前的领域无关实体链接系统。我们还在源自WikilinksNED数据集(Eshel et al., 2017)的更困难设定中测试我们的方法,其中所有提及-实体对在测试时均未见。结果表明我们的方法在该数据集上比SOTA神经模型泛化得更好。
引用
@article{arxiv.1909.05780,
title = {Fine-Grained Entity Typing for Domain Independent Entity Linking},
author = {Yasumasa Onoe and Greg Durrett},
journal= {arXiv preprint arXiv:1909.05780},
year = {2020}
}
备注
AAAI 2020