基于对抗表示学习的异构信息网络作者名消歧
社会与信息网络
2020-02-25 v1 数字图书馆
摘要
作者名歧义导致学术信息检索中的不充分与不便,这凸显了作者名消歧(AND)的必要性。现有 AND 方法可分为两类:一类聚焦于内容信息以区分两篇论文是否由同一作者撰写,另一类聚焦于关系信息,将信息表示为网络上的边并量化论文间的相似度。然而,前者需要充足的标注样本与信息丰富的负样本,且在度量论文间高阶连接上效果不佳;后者则需要复杂的特征工程或监督来构建网络。我们提出一种新颖的生成对抗框架,使这两类模型共同成长:(i)判别模块区分两篇论文是否来自同一作者,(ii)生成模块直接从异构信息网络中选择可能同质的论文,从而免除了复杂的特征工程。如此,判别模块引导生成模块选择同质论文,而生成模块生成高质量负样本来训练判别模块,使其感知论文间的高阶连接。此外,为判别模块设计了自训练策略,并基于随机游走设计了生成算法,以使训练稳定高效。在两个真实世界 AND 基准上的大量实验表明,我们的模型相较最先进的方法取得了显著的性能提升。
引用
@article{arxiv.2002.09803,
title = {Author Name Disambiguation on Heterogeneous Information Network with Adversarial Representation Learning},
author = {Haiwen Wang and Ruijie Wang and Chuan Wen and Shuhao Li and Yuting Jia and Weinan Zhang and Xinbing Wang},
journal= {arXiv preprint arXiv:2002.09803},
year = {2020}
}
备注
AAAI 2020