从无标签数据对进行监督分类时缓解过拟合:一种一致性风险校正方法
机器学习
2020-04-01 v4 机器学习
摘要
近年来提出的无标签-无标签(UU)分类方法使我们仅能利用两个具有不同类先验的无标签数据集来训练二分类器。由于该方法基于经验风险最小化,其运作方式类似于监督分类方法,可与任意模型和优化器兼容。然而,该方法有时会遭受严重的过拟合,本文旨在防止这一问题。我们在应用原始UU方法时的经验发现是,过拟合常与经验风险变为负值同时发生,而这是不合法的。因此,我们提出将引起负经验风险的项用特定的校正函数进行包裹。随后,我们证明了校正后风险估计量的一致性,并推导了校正后风险最小化器的估计误差界。实验表明,我们的方案能成功缓解UU方法的过拟合,并显著提升分类准确率。
引用
@article{arxiv.1910.08974,
title = {Mitigating Overfitting in Supervised Classification from Two Unlabeled Datasets: A Consistent Risk Correction Approach},
author = {Nan Lu and Tianyi Zhang and Gang Niu and Masashi Sugiyama},
journal= {arXiv preprint arXiv:1910.08974},
year = {2020}
}