中文

从正类任意偏移的正未标记数据中学习

机器学习 2020-11-10 v4 机器学习

摘要

正未标记(PU)学习仅使用正类和未标记数据来训练二分类器。一个常见的简化假设是正类数据能代表目标正类。由于时间漂移、域偏移和/或对抗性操纵,该假设在实践中很少成立。本文表明,给定来自源分布和目标分布的未标记数据,即使正类数据任意不具代表性,PU 学习也是可能的。我们的关键见解是只有负类的分布需要固定。我们将其整合到两种统计一致的方法中以应对任意正类偏置——一种方法将负未标记学习与未标记未标记学习相结合,另一种使用一种新颖的递归风险估计器。实验结果在众多真实世界数据集和多种正类偏置形式(包括不相交的正类条件支持)上证明了我们方法的有效性。此外,我们提出了一种通用的简化方法来解决 PU 风险估计过拟合问题。

关键词

引用

@article{arxiv.2002.10261,
  title  = {Learning from Positive and Unlabeled Data with Arbitrary Positive Shift},
  author = {Zayd Hammoudeh and Daniel Lowd},
  journal= {arXiv preprint arXiv:2002.10261},
  year   = {2020}
}

备注

Accepted at NeurIPS'20