验证正无标签学习中的完全随机选择假设
机器学习
2024-04-02 v1 机器学习
摘要
正无标签(PU)学习的目标是基于包含正例和无标签实例的训练数据训练一个二分类器,其中无标签观测值可能属于正类或负类。对PU数据进行建模需要对描述哪些正观测值被赋予标签的标注机制做出某些假设。早期工作中考虑的最简单假设是SCAR(完全随机选择假设),根据该假设,倾向得分函数(定义为给正观测值赋予标签的概率)是常数。另一方面,一个更现实的假设是SAR(随机选择),它指出倾向函数仅依赖于观测到的特征向量。与通常需要挑战性估计倾向得分的SAR算法相比,基于SCAR的算法更简单且计算速度更快。在这项工作中,我们提出了一个相对简单且计算快速的检验,可用于确定观测数据是否满足SCAR假设。我们的检验基于生成符合SCAR情况的人工标签,从而可以在SCAR原假设下模拟检验统计量的分布。我们从理论上证明了该方法的合理性。在实验中,我们展示了该检验能成功检测出对SCAR情景的各种偏离,同时能有效控制第一类错误。当标注机制的性质未知时,所提出的检验可作为预处理步骤,用于决定选择哪种最终PU算法。
引用
@article{arxiv.2404.00145,
title = {Verifying the Selected Completely at Random Assumption in Positive-Unlabeled Learning},
author = {Paweł Teisseyre and Konrad Furmańczyk and Jan Mielniczuk},
journal= {arXiv preprint arXiv:2404.00145},
year = {2024}
}