大规模异质学术网络中基于成对学习的同名消歧
数字图书馆
2021-01-21 v4 机器学习
社会与信息网络
机器学习
摘要
同名消歧旨在识别同名下的不同真实作者。现有同名消歧方法常利用作者属性以提升消歧效果。然而,部分判别性作者属性(如邮箱与单位)可能因毕业或跳槽而改变,从而导致同一作者论文在数字图书馆中被分隔。尽管这些属性可能变化,作者的合作者与研究方向不会随时间频繁改变,这意味着某一时段内的论文在学术网络中有相似的文本与关系信息。受此启发,我们引入基于多视图注意力的成对循环神经网络(MA-PairRNN)解决同名消歧问题。我们依据判别性作者属性将论文划分为小块,并基于 MA-PairRNN 的成对分类结果合并同一作者的块。MA-PairRNN 将异质图嵌入学习与成对相似度学习整合于一个框架。除属性与结构信息外,MA-PairRNN 还通过元路径以归纳方式利用语义信息并生成节点表示,可扩展至大图。此外,采用语义级注意力机制融合多个基于元路径的表示。由两路 RNN 组成的伪孪生网络以出版时间顺序的两篇论文序列为输入,输出其相似度。在两个真实数据集上的结果表明,我们的框架在同名消歧任务上取得显著且一致的性能提升。同时证明 MA-PairRNN 能在少量训练数据下表现良好,并具备跨不同研究领域的更好泛化能力。
引用
@article{arxiv.2008.13099,
title = {Pairwise Learning for Name Disambiguation in Large-Scale Heterogeneous Academic Networks},
author = {Qingyun Sun and Hao Peng and Jianxin Li and Senzhang Wang and Xiangyu Dong and Liangxuan Zhao and Philip S. Yu and Lifang He},
journal= {arXiv preprint arXiv:2008.13099},
year = {2021}
}
备注
accepted by ICDM 2020 as regular paper