基于变分自编码器的开放知识图谱规范化
计算与语言
2021-09-29 v2 人工智能
信息检索
机器学习
摘要
开放知识图谱中的名词短语与关系短语未经规范化,导致冗余且歧义的主语-关系-宾语三元组激增。解决该问题的现有方法采用两步法。首先,它们为名词与关系短语生成嵌入表示,随后使用聚类算法以嵌入作为特征对其进行分组。在本工作中,我们提出使用变分自编码器进行规范化(CUVA),一种以端到端方式联合学习嵌入与聚类分配的模型,从而为名词与关系短语带来更好的向量表示。我们在多个基准上的评估表明 CUVA 优于现有最先进方法。此外,我们引入 CanonicNell,一个用于评估实体规范化系统的新数据集。
引用
@article{arxiv.2012.04780,
title = {Open Knowledge Graphs Canonicalization using Variational Autoencoders},
author = {Sarthak Dash and Gaetano Rossiello and Nandana Mihindukulasooriya and Sugato Bagchi and Alfio Gliozzo},
journal= {arXiv preprint arXiv:2012.04780},
year = {2021}
}
备注
Accepted to EMNLP 2021