评估数字图书馆中的作者名消歧:以 DBLP 为例
数字图书馆
2018-07-31 v2 信息检索
摘要
数字图书馆中的作者名歧义可能影响基于该馆作者数据挖掘的研究结论。本研究评估了 DBLP 这一广泛使用但消歧性能评估不足的数字图书馆中的作者名消歧。为此,本研究采用三角验证方法,认为当数字图书馆的消歧性能在多个标注数据集上评估并与基线比较时,可得到更好的评价。在包含 5,000 至 700K 个已消歧名称及 600 万对已消歧名称的三类标注数据上测试,DBLP 被证明能将作者名相当准确地分配给不同作者,总体成对精确率、召回率和 F1 度量约为 0.90 或以上。DBLP 的作者名消歧即使在大型歧义姓名块上也表现良好,但在区分同名作者方面存在不足。与其他消歧算法相比,DBLP 的消歧性能颇具竞争力,这可能归功于其结合算法消歧与人工纠错的混合消歧方法。随后讨论了本研究所用标注数据集的优缺点,以供未来在数字图书馆规模上评估作者名消歧之参考。
引用
@article{arxiv.1806.10540,
title = {Evaluating author name disambiguation for digital libraries: A case of DBLP},
author = {Jinseok Kim},
journal= {arXiv preprint arXiv:1806.10540},
year = {2018}
}
备注
Scientometrics (2018)