中文

一种从正例和无标注样本中学习的Bagging SVM方法

机器学习 2010-10-06 v1

摘要

我们考虑从包含正例和无标注样本的训练集中学习二分类器的问题,涵盖归纳式和直推式两种设定。该问题通常被称为“PU学习”,与标准监督分类问题的区别在于训练集中缺少负例。这在许多应用中是一种普遍情况,例如信息检索或基因排序,当我们已识别出一组具有特定属性的感兴趣数据,并希望从大量易获取的无标注数据池中自动检索出具有相同属性的其他数据时。我们提出了一种概念上简单的方法,类似于Bagging,通过将归纳式和直推式PU学习问题转化为一系列有监督的二分类问题(区分已知正例与无标注集的随机子样本)来处理。我们在模拟数据和真实数据上实证证明了该方法的有效性,其性能至少与现有方法相当,同时速度更快。

关键词

引用

@article{arxiv.1010.0772,
  title  = {A bagging SVM to learn from positive and unlabeled examples},
  author = {Fantine Mordelet and Jean-Philippe Vert},
  journal= {arXiv preprint arXiv:1010.0772},
  year   = {2010}
}