中文

从正类与未标记数据的主动学习

机器学习 2016-11-17 v1

摘要

近年来,主动学习已发展成为一种利用用户反馈来提高学习算法精度的流行范式。主动学习通过从未标记数据中选择信息量最大的样本并向用户查询该点的标签来工作。许多不同的方法如不确定性采样和最小风险采样已被用于主动学习中选择信息量最大的样本。尽管迄今为止已提出许多主动学习算法,但它们大多处理二分类或多分类问题,因此无法应用于仅有一类样本以及一组未标记数据可用的问题。此类问题出现在许多现实场景中,被称为从正类与未标记数据学习的问题。本文中我们提出一种主动学习算法,其可在仅有一类样本以及一组未标记数据可用时工作。我们的方法通过分别估计正类与未标记点的概率密度,然后计算信息量的期望值,从而摆脱一个超参数并获得更好的信息量度量。实验与实证分析显示了相较于其他类似方法有前景的结果。

关键词

引用

@article{arxiv.1602.07495,
  title  = {Active Learning from Positive and Unlabeled Data},
  author = {Alireza Ghasemi and Hamid R. Rabiee and Mohsen Fadaee and Mohammad T. Manzuri and Mohammad H. Rohban},
  journal= {arXiv preprint arXiv:1602.07495},
  year   = {2016}
}

备注

6 pages, presented at IEEE ICDM 2011 Workshops