中文

重新思考正-无标签学习中的类先验估计

机器学习 2022-06-06 v2 机器学习

摘要

在仅给定正类(P)和无标签(U)数据的情况下,PU 学习可以在没有任何负类数据的情况下训练二分类器。它包含两个组成部分:PU 类先验估计(CPE)和 PU 分类;后者已被充分研究,而前者受到的关注较少。迄今为止,无分布假设的 CPE 方法依赖于一个关键假设,即正类数据分布的支持集不能被负类数据分布的支持集所包含。若此假设被违背,这些 CPE 方法将系统性地高估类先验;更糟糕的是,我们无法基于数据验证该假设。在本文中,我们重新思考 PU 学习的 CPE——我们能否去除该假设以使 CPE 始终有效?我们通过提出重组 CPE(ReCPE)给出了肯定答案,该方法构建一个辅助概率分布,使得正类数据分布的支持集永远不会被负类数据分布的支持集所包含。ReCPE 可将任意 CPE 方法作为基方法来使用。理论上,若原概率分布已满足该假设,ReCPE 不影响其基方法;否则,它降低其基方法的正向偏差。在实验上,ReCPE 在多个数据集上改进了所有最先进的 CPE 方法,这意味着该假设在此确实被违背了。

关键词

引用

@article{arxiv.2002.03673,
  title  = {Rethinking Class-Prior Estimation for Positive-Unlabeled Learning},
  author = {Yu Yao and Tongliang Liu and Bo Han and Mingming Gong and Gang Niu and Masashi Sugiyama and Dacheng Tao},
  journal= {arXiv preprint arXiv:2002.03673},
  year   = {2022}
}