中文

基于正类、未标注与有偏负类数据的分类

机器学习 2019-07-16 v2 机器学习

摘要

在二分类中,存在负类(N)数据过于多样而难以完全标注的情况,我们常在此类场景下求助于正类-未标注(PU)学习。然而,在实践中收集仅包含全部可能负类数据中一小部分的非代表性负类集合往往容易得多。本文研究了一种新颖的分类框架,该框架在PU学习中引入了此类有偏负类(bN)数据。我们提供了一种基于经验风险最小化的方法来解决这一PUbN分类问题。我们的方法可视为一种新颖的样例加权算法,其中每个样例的权重通过受PU学习启发的预备步骤计算。我们还推导了所提方法的估计误差界。实验结果表明,我们的算法在多个基准数据集上不仅于PUbN学习场景中有效,在普通PU学习场景中也同样有效。

关键词

引用

@article{arxiv.1810.00846,
  title  = {Classification from Positive, Unlabeled and Biased Negative Data},
  author = {Yu-Guan Hsieh and Gang Niu and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:1810.00846},
  year   = {2019}
}

备注

In Proceedings of the 36th International Conference on Machine Learning (ICML 2019)