关于作者消歧:以自底向上方式重构合作网络
信息检索
2020-12-01 v1
摘要
当不同作者共享同一姓名时,就会出现作者消歧问题,这是数字图书馆(如 DBLP、CiteULike、CiteSeerX 等)中的一项关键任务。尽管最先进的方法已开发出各种基于论文嵌入的自顶向下方法,但它们主要关注目标姓名的自我网络(ego-network),而忽略了该网络中存在的低质量合作关系。因此,这些方法在作者消歧方面可能并非最优。在本文中,我们将作者消歧建模为合作网络重构问题,并提出了一种增量式无监督作者消歧方法,即 IUAD,它以自底向上的方式执行。最初,我们基于稳定的合作关系构建一个稳定的合作网络。为了进一步提高召回率,我们构建了一个概率生成模型来重构完整的合作网络。此外,对于新发表的论文,我们只需计算后验概率即可增量式地判断其作者。我们在大规模 DBLP 数据集上进行了广泛实验来评估 IUAD。实验结果表明,IUAD 不仅取得了令人满意的性能,而且显著优于可比较的基线。代码可在 https://github.com/papergitgit/IUAD 获取。
引用
@article{arxiv.2011.14333,
title = {On Disambiguating Authors: Collaboration Network Reconstruction in a Bottom-up Manner},
author = {Na Li and Renyu Zhu and Xiaoxu Zhou and Xiangnan He and Wenyuan Cai and Ming Gao and Aoying Zhou},
journal= {arXiv preprint arXiv:2011.14333},
year = {2020}
}