中文

CoType:基于知识库的类别化实体与关系联合抽取

计算与语言 2017-06-06 v2 机器学习

摘要

从文本中提取感兴趣类型的实体和关系对于理解大规模文本语料库非常重要。传统上,实体关系抽取系统依赖人工标注的语料库进行训练并采用增量流水线。此类系统需要额外的人类专业知识才能移植到新领域,并且容易受到流水线下游错误级联的影响。在本文中,我们研究利用从知识库(即远程监督)启发式获得的标注数据联合抽取类型化实体和关系。由于我们通过远程监督进行类型标注的算法与上下文无关,噪声训练数据给该任务带来了独特的挑战。我们提出了一个名为CoType的新颖领域独立框架,该框架运行数据驱动的文本分割算法来提取实体提及,并将实体提及、关系提及、文本特征和类型标签联合嵌入到两个低维空间(分别用于实体和关系提及)中,在每个空间中,类型相近的对象也将具有相似的表示。然后,CoType使用这些学习到的嵌入来估计测试(不可链接)提及的类型。我们制定了一个联合优化问题以从文本语料库和知识库学习嵌入,采用一种用于噪声标注数据的新型部分标签损失函数,并引入对象“翻译”函数以捕获实体和关系彼此的交叉约束。在三个公共数据集上的实验证明了CoType跨不同领域(例如新闻、生物医学)的有效性,与次优方法相比F1分数平均提高25%。

关键词

引用

@article{arxiv.1610.08763,
  title  = {CoType: Joint Extraction of Typed Entities and Relations with Knowledge Bases},
  author = {Xiang Ren and Zeqiu Wu and Wenqi He and Meng Qu and Clare R. Voss and Heng Ji and Tarek F. Abdelzaher and Jiawei Han},
  journal= {arXiv preprint arXiv:1610.08763},
  year   = {2017}
}

备注

WWW 2017