中文

基于统计杠杆分数的主动学习方法

机器学习 2018-12-07 v1 机器学习

摘要

在许多现实世界的机器学习应用中,未标记数据丰富,而类标签昂贵且稀缺。主动学习器旨在通过有效选择有用样本进行标注,以尽可能少的标记实例获得高精度的模型。我们提出了一种基于统计杠杆分数的新选择准则,并基于此准则给出了两种新颖的主动学习方法:ALEVS用于每次迭代查询单个样本,DBALEVS用于查询一批样本。为评估样本池中样本的代表性,ALEVS和DBALEVS使用在每个类别的样本上计算得到的核矩阵的统计杠杆分数。此外,DBALEVS通过最大化由统计杠杆分数和样本池上计算的核矩阵定义的子模集函数,选择一组具有高代表性但与已标注样本不相似的不同样本。该集评分函数的子模性使我们能够以常数因子近似高效地识别出接近最优批次的样本集。我们在多个数据集上的实验表明,基于杠杆分数的查询是一种强有力的主动学习策略。

关键词

引用

@article{arxiv.1812.02497,
  title  = {Active Learning Methods based on Statistical Leverage Scores},
  author = {Cem Orhan and Oznur Tastan},
  journal= {arXiv preprint arXiv:1812.02497},
  year   = {2018}
}

备注

Submitted to Machine Learning Journal, EMLP 2019 journal track