基于相对频率的高效无监督作者消歧
信息检索
2018-08-14 v1 计算与语言
机器学习
机器学习
摘要
本工作解决Web of Science中的作者同名同姓问题。为寻求高效、简单且直接的解决方案,我们引入一种基于特征重叠的作者名消歧新型概率相似度度量。利用Web of Science子集可用的研究者ID,我们在凝聚式聚类作者提及的语境下评估该度量的应用。我们聚焦于一个简洁的评估,清晰展示在哪些问题设定下以及聚类过程的哪个阶段我们的方法效果最佳。与该领域多数其他工作不同,我们对作者名消歧方法的总体性能持怀疑态度,并将我们的方法与平凡单簇基线进行比较。我们的结果按每个正确聚类大小分别呈现,因为我们可以解释当所有情况一起处理时,平凡基线与更复杂方法在评估结果上几乎无法区分。我们的模型在所有正确聚类大小上均展现出SOTA性能,且无需任何判别训练,仅调优一个收敛参数。
引用
@article{arxiv.1808.04216,
title = {Effective Unsupervised Author Disambiguation with Relative Frequencies},
author = {Tobias Backes},
journal= {arXiv preprint arXiv:1808.04216},
year = {2018}
}
备注
Proceedings of JCDL 2018