中文

训练数据不平衡对作者名消歧机器学习的影响

信息检索 2018-08-06 v2 计算与语言 数字图书馆 机器学习 机器学习

摘要

在用于作者名消歧的有监督机器学习中,负训练数据通常远多于正训练数据。本文考察负训练数据与正训练数据的比例如何影响机器学习算法在文献记录中消歧作者名的性能。在多个标注数据集上,通过来自相同训练数据但具有不同正负训练数据比例的特征(如合作者姓名、标题词),训练了三种分类器——逻辑回归、朴素贝叶斯和随机森林。结果表明,增加负训练数据可提升消歧性能,但性能增益仅几个百分点,有时甚至会下降。逻辑回归和朴素贝叶斯即使在正负训练数据基础比例(1:1)下也能学习到最优消歧模型。此外,随机森林的性能提升在约1:10~1:15之后趋于快速饱和。这些发现意味着,与使用全部训练数据的常见做法相反,作者名消歧算法可使用部分负训练数据进行训练,在不显著降低消歧性能的同时提升计算效率。本研究呼吁作者名消歧研究者更多关注不平衡数据机器学习方法。

关键词

引用

@article{arxiv.1808.00525,
  title  = {The impact of imbalanced training data on machine learning for author name disambiguation},
  author = {Jinseok Kim and Jenna Kim},
  journal= {arXiv preprint arXiv:1808.00525},
  year   = {2018}
}

备注

17 pages, 3 figures, and 3 tables