文献计量数据中的作者名消歧:几种无监督方法的比较
数字图书馆
2019-04-30 v1
摘要
在文献计量数据库中充分消歧作者名,是在作者层面开展可靠分析的前提条件。对于包含众多研究者的文献计量研究,逐一手动消歧每位研究者是不可能的。已有若干作者名消歧方法被提出,但尚未在受控条件下对它们进行比较。在本研究中,我们比较了一组无监督消歧方法。无监督方法事先指定一个模型来评估作者提及的相似性,而非利用标注数据训练模型。为评估这些方法,我们将它们应用于一组由 ResearcherID 标注的作者提及集合,ResearcherID 是由研究者本人维护的作者标识符。除比较整体性能外,我们更详细地考察了方法参数化的作用,并分析了结果对消歧任务复杂度的依赖性。结果表明,所有被评估的方法均优于仅利用作者名所能获得的结果。在本研究背景下,Caron 与 van Eck(2014)提出的方法取得了最佳结果。
引用
@article{arxiv.1904.12746,
title = {Author name disambiguation of bibliometric data: A comparison of several unsupervised approaches},
author = {Alexander Tekles and Lutz Bornmann},
journal= {arXiv preprint arXiv:1904.12746},
year = {2019}
}