中文

从非标注文本学习关系原型用于长尾关系抽取

计算与语言 2020-11-30 v1 机器学习

摘要

关系抽取(RE)是从文本中抽取实体关系以补全知识图谱(KG)的关键步骤。然而,它通常受长尾问题困扰。训练数据主要集中于少数关系类型,导致其余关系类型缺乏充足标注。本文中,我们提出一种通用方法,从非标注文本学习关系原型,通过从具有充足训练数据的关系类型迁移知识,以促进长尾关系抽取。我们将关系原型学习为实体间的隐式因子,反映关系含义及其用于迁移学习的邻近度。具体而言,我们从文本构建共现图,并捕获一阶与二阶实体邻近度用于嵌入学习。在此基础上,我们进一步优化实体对到相应原型的距离,可轻松适配几乎所有任意RE框架。因此,低频甚至未见过的关系类型的学习将受益于语义邻近关系经由实体对与大规模文本信息。我们在两个公开数据集(New York Times 与 Google Distant Supervision)上进行了广泛实验。与八个最先进基线相比,我们提出的模型取得显著提升(平均4.1% F1)。在长尾关系上的进一步结果证明了所学关系原型的有效性。我们进一步开展消融研究以探究各组件影响,并将其应用于四个基础关系抽取模型以验证泛化能力。最后,我们分析若干案例作为定性分析给出直观印象。我们的代码稍后发布。

关键词

引用

@article{arxiv.2011.13574,
  title  = {Learning Relation Prototype from Unlabeled Texts for Long-tail Relation Extraction},
  author = {Yixin Cao and Jun Kuang and Ming Gao and Aoying Zhou and Yonggang Wen and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2011.13574},
  year   = {2020}
}