中文

基于变分自编码器的开放知识图谱规范化

计算与语言 2021-09-29 v2 人工智能 信息检索 机器学习

摘要

开放知识图谱中的名词短语与关系短语未经规范化,导致冗余且歧义的主语-关系-宾语三元组激增。解决该问题的现有方法采用两步法。首先,它们为名词与关系短语生成嵌入表示,随后使用聚类算法以嵌入作为特征对其进行分组。在本工作中,我们提出使用变分自编码器进行规范化(CUVA),一种以端到端方式联合学习嵌入与聚类分配的模型,从而为名词与关系短语带来更好的向量表示。我们在多个基准上的评估表明 CUVA 优于现有最先进方法。此外,我们引入 CanonicNell,一个用于评估实体规范化系统的新数据集。

关键词

引用

@article{arxiv.2012.04780,
  title  = {Open Knowledge Graphs Canonicalization using Variational Autoencoders},
  author = {Sarthak Dash and Gaetano Rossiello and Nandana Mihindukulasooriya and Sugato Bagchi and Alfio Gliozzo},
  journal= {arXiv preprint arXiv:2012.04780},
  year   = {2021}
}

备注

Accepted to EMNLP 2021