基于知识图谱嵌入利用字面量进行作者名消歧的方法
人工智能
2022-06-02 v3 计算与语言
数字图书馆
摘要
学术数据持续增长,包含来自会议、期刊等众多场所的论文信息。许多举措已使学术数据作为知识图谱(KGs)可用。这些标准化和开放数据的努力也带来了许多挑战,如学术文章探索、作者歧义等。本研究更具体地针对学术知识图谱上的作者名消歧(AND)问题,提出了一种新颖框架 Literally Author Name Disambiguation(LAND),其利用从这些知识图谱生成的多模态字面量信息通过知识图谱嵌入(KGEs)进行消歧。该框架基于三个组件:1)多模态 KGEs,2)分块过程,以及 3)层次凝聚聚类。在两个新建知识图谱上进行了大量实验:(i)包含 1978 年以来 Scientometrics 期刊信息的 KG(OC-782K),以及(ii)从 AMiner 提供的知名 AND 基准提取的 KG(AMiner-534K)。结果表明,我们提出的架构在 F1 分数上比基线高出 8-14%,并在 AMiner 等具有挑战性的基准上表现出有竞争力的性能。代码和数据集分别通过 Github: https://github.com/sntcristian/and-kge 和 Zenodo: https://doi.org/10.5281/zenodo.6309855 公开可用。
引用
@article{arxiv.2201.09555,
title = {A Knowledge Graph Embeddings based Approach for Author Name Disambiguation using Literals},
author = {Cristian Santini and Genet Asefa Gesese and Silvio Peroni and Aldo Gangemi and Harald Sack and Mehwish Alam},
journal= {arXiv preprint arXiv:2201.09555},
year = {2022}
}