基于置信度偏倚的正类数据二分类
机器学习
2020-01-30 v1 机器学习
摘要
正类置信度(Pconf)分类[Ishida et al., 2018]是一种很有前景的弱监督学习方法,它仅从带有置信度的正类数据中训练二分类器。然而在实践中,置信度可能因标注过程中产生的偏差而发生偏倚。Pconf分类器无法在偏倚置信度下被正确学习,从而导致分类性能下降。本文中,我们引入偏倚置信度的参数化模型,并在假设已知正类样本误分类率作为先验知识的条件下,提出一种选择超参数以抵消偏倚置信度负面影响的方法。我们通过简单线性模型的合成实验以及神经网络模型的基准问题证明了所提方法的有效性。我们还将该方法应用于驾驶员 drowsiness 预测,以表明它能在基于人工标注获得置信度的真实世界问题中良好运作。
引用
@article{arxiv.2001.10642,
title = {Binary Classification from Positive Data with Skewed Confidence},
author = {Kazuhiko Shinoda and Hirotaka Kaji and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2001.10642},
year = {2020}
}