中文

DEDPUL:基于密度估计差的正-无标签学习

机器学习 2020-06-09 v5 机器学习

摘要

正-无标签(PU)学习是监督式二分类的一种类比,适用于仅正样本是干净的,而负样本被正类的潜在实例污染、因而可视为无标签混合体的情形。其目标是分类无标签样本并训练无偏的PN分类器,这通常首先需要确定正类与负类的混合比例。近来,无偏风险估计框架在PU学习中取得了最先进的性能。然而,该方法存在两个主要瓶颈。第一,混合比例被假定为已确定,即领域内已知或通过额外方法估计。第二,该方法依赖于分类器为神经网络。本文中,我们提出DEDPUL,一种解决上述问题的PU学习方法。DEDPUL背后的机制是对任何训练用于区分正类与无标签数据的分类器的预测结果施加计算代价低廉的后处理步骤。DEDPUL不假定比例已知,而是在分类无标签样本的同时估计它们。实验表明,DEDPUL在比例估计和PU分类两方面均优于当前最先进水平。

关键词

引用

@article{arxiv.1902.06965,
  title  = {DEDPUL: Difference-of-Estimated-Densities-based Positive-Unlabeled Learning},
  author = {Dmitry Ivanov},
  journal= {arXiv preprint arXiv:1902.06965},
  year   = {2020}
}

备注

Implementation of DEDPUL and experimental data are available at https://github.com/dimonenka/DEDPUL