中文

基于多片段双向上下文匹配的实体同义发现

计算与语言 2020-05-12 v2 人工智能

摘要

能够在开放世界环境中自动发现同义实体有益于实体消歧或知识图谱规范化等多种任务。现有工作要么仅利用实体特征,要么依赖于实体被提及处的单片段结构化标注。为利用实体被提及的多样化上下文,本文中将分布假说推广至多上下文设定,并提出一种从自由文本语料中发现实体同义的框架,兼顾有效性与鲁棒性。作为同义发现的关键组成部分之一,我们引入了神经网络模型SYNONYMNET来判断两个给定实体是否互为同义。SYNONYMNET不使用实体特征,而是利用实体被提及的多片段上下文,并通过双向匹配模式比较上下文级相似度。实验结果表明,所提模型能够在通用和领域特定数据集(Wiki+Freebase、PubMed+UMLS和MedBook+MKG)上检测出训练期间未观测到的同义集合:与最佳基线方法相比,曲线下面积(AUC)提升达4.16%,平均精度均值(MAP)提升达3.19%。

关键词

引用

@article{arxiv.1901.00056,
  title  = {Entity Synonym Discovery via Multipiece Bilateral Context Matching},
  author = {Chenwei Zhang and Yaliang Li and Nan Du and Wei Fan and Philip S. Yu},
  journal= {arXiv preprint arXiv:1901.00056},
  year   = {2020}
}

备注

In IJCAI 2020 as a long paper. Code and data are available at https://github.com/czhang99/SynonymNet