中文

改进正无标签学习:实用 AUL 估计与面向极不平衡数据集的新训练方法

机器学习 2020-04-22 v1 机器学习

摘要

正无标签(PU)学习广泛应用于许多应用中,其中二分类器在仅包含正样本和未标记样本的数据集上进行训练。本文从两个方面改进了 PU 学习,使其超越现有技术。首先,现有的 PU 学习模型评估方法需要未标记样本的真实标签,这在实践中难以获取。为解除此限制,我们提出了一种渐近无偏的实用 AUL(lift 下的面积)估计方法,该方法利用原始 PU 数据,无需未标记样本的先验知识。其次,我们提出了 ProbTagging,一种针对极不平衡数据集的新训练方法,其中未标记样本的数量是正样本的数百或数千倍。ProbTagging 将概率引入聚合方法中。具体而言,每个未标记样本基于其与正样本邻居的相似度计算出的概率被标记为正或负。基于此,生成多个数据集以训练不同的模型,随后将其组合为一个集成模型。在三个工业和两个人工 PU 数据集上的实验结果表明,与现有技术工作相比,ProbTagging 可将 AUC 提高多达 10%。

关键词

引用

@article{arxiv.2004.09820,
  title  = {Improving Positive Unlabeled Learning: Practical AUL Estimation and New Training Method for Extremely Imbalanced Data Sets},
  author = {Liwei Jiang and Dan Li and Qisheng Wang and Shuai Wang and Songtao Wang},
  journal= {arXiv preprint arXiv:2004.09820},
  year   = {2020}
}

备注

10 pages, 4 figures