中文

MixPUL:基于一致性的正类与未标记学习数据增强方法

机器学习 2020-04-21 v1 机器学习

摘要

从正类与未标记数据学习(PU 学习)在仅少量样本被正标记的实际应用中十分普遍。以往的 PU 学习研究通常依赖于已有样本,因而数据分布未被充分探索。本文中,我们提出一种简单而有效的数据增强方法,称为 MixPUL,其基于一致性正则化,为正类与未标记数据的使用提供了新视角。具体而言,提出的 MixPUL 结合有监督与无监督一致性训练来生成增强数据。为便于有监督一致性,由于负样本缺失,从未标记数据中挖掘可靠负例。进一步鼓励未标记数据点之间的无监督一致性。此外,MixPUL 减小正类与未标记对之间的间隔损失,显式优化 AUC 并带来更快收敛。最后,我们进行了一系列研究以证明一致性正则化的有效性。我们考察了三种可靠负例挖掘方法。我们表明,在不同正类数据量下,MixPUL 在 CIFAR-10 数据集上使分类错误率从 16.49 平均降至 13.09。

关键词

引用

@article{arxiv.2004.09388,
  title  = {MixPUL: Consistency-based Augmentation for Positive and Unlabeled Learning},
  author = {Tong Wei and Feng Shi and Hai Wang and Wei-Wei Tu. Yu-Feng Li},
  journal= {arXiv preprint arXiv:2004.09388},
  year   = {2020}
}