通过识别标注过程从正类与未标注数据中学习
机器学习
2020-03-03 v1 统计方法学
机器学习
摘要
在二分类中,从正类与未标注数据学习(LePU)是一种半监督学习,但仅有一类的标注样本。大多数LePU研究依赖于某种形式的标注样本选择过程与标注类特征之间的独立性,即完全随机选择(SCAR)假设。然而标注过程是数据收集的重要部分,且在许多情况下它自然依赖于数据的某些特征(例如图像的强度和图像中待检测物体的大小)。若对标注过程的模型无任何约束,LePU问题的分类结果将高度非唯一。因此需要恰当、灵活的约束。本工作中,我们引入了比SCAR更灵活且更现实的标注过程模型,更重要的是,为这一具挑战性的LePU问题提供了解决方案。在理论方面,鉴于所考虑的数据生成过程约束,我们建立了标注过程性质和分类函数的可识别性。我们还提出了一种推断算法来学习模型参数,在模拟和真实数据上均取得了成功的实验结果。我们还提出了一个新的真实世界LePU数据集,作为未来研究的基准数据集。
引用
@article{arxiv.2003.01067,
title = {Learning from Positive and Unlabeled Data by Identifying the Annotation Process},
author = {Naji Shajarisales and Peter Spirtes and Kun Zhang},
journal= {arXiv preprint arXiv:2003.01067},
year = {2020}
}
备注
Submitted to UAI 2020