中文

面向USPTO发明人姓名消歧的随机森林DBSCAN

信息检索 2017-09-15 v4

摘要

姓名消歧及随后的姓名合并对于数字图书馆或其他数据库中人名查询的正确处理至关重要。它可将每个唯一个体与数据库中的所有其他记录区分开。我们利用先前作者姓名消歧工作的方法和特征,研究专利数据库的发明人姓名消歧,并提出一套适用于专利数据库的特征集。随机森林被选作成对链接分类器,因为其性能优于朴素贝叶斯、逻辑回归、支持向量机(SVM)、条件推断树和决策树。对于扩展性至关重要的分块大小,基于确定特征重要性和准确性的实验选定。DBSCAN算法用于记录聚类,使用从随机森林分类器导出的距离函数。为进一步提升可扩展性,聚类被并行化。在USPTO专利数据库上的测试表明,我们的方法在6.5小时内成功消歧了1200万条发明人提及。在来自USPTO PatentsView发明人姓名消歧竞赛的数据集上的评估显示,我们的算法优于竞赛中的所有算法。

关键词

引用

@article{arxiv.1602.01792,
  title  = {Random Forest DBSCAN for USPTO Inventor Name Disambiguation},
  author = {Kunho Kim and Madian Khabsa and C. Lee Giles},
  journal= {arXiv preprint arXiv:1602.01792},
  year   = {2017}
}