利用 CNF 分块扩展作者姓名消歧
信息检索
2017-09-28 v1 数字图书馆
摘要
作者姓名消歧(AND)算法从学术或类似数据库中所有相似或相同的出版记录中识别出唯一的作者实体记录。通常,使用的是需要对每对可能的记录对计算相似度的聚类方法。然而,记录对的总数随作者数据库的规模呈二次增长,使得对数百万条记录进行此类聚类变得困难。一种补救措施是使用分块函数来减少成对相似度计算的数量。在此,我们引入了一种利用合取范式(CNF)学习分块方案的新方法,以区别于析取范式(DNF)。我们在 PubMed 作者记录上证明,与以往使用 DNF 的方法相比,CNF 分块在保持高配对完整性的同时减少了更多的记录对,且计算时间显著缩短。因此,学术数据中的这些概念可以更好地用 CNF 表示。此外,我们还展示了如何确保该方法产生不相交的块,以便 AND 算法的其余部分可以轻松并行化。我们在包含 8000 万条作者提及的整个 PubMed 数据库上测试了 CNF 分块,在 10 分钟内高效移除了 82.17% 的所有作者记录对。
引用
@article{arxiv.1709.09657,
title = {Scaling Author Name Disambiguation with CNF Blocking},
author = {Kunho Kim and Athar Sefid and C. Lee Giles},
journal= {arXiv preprint arXiv:1709.09657},
year = {2017}
}