实例依赖的正-无标记数据的联合经验风险最小化
机器学习
2023-12-29 v1 机器学习
摘要
从正样本和无标记数据中学习(PU学习)是一个活跃研究的机器学习任务。目标是基于一个训练数据集训练二分类模型,该数据集包含部分被标记的正样本和无标记实例。无标记集包括剩余的正样本和所有负样本。PU学习中的一个重要元素是标记机制的建模,即标签分配给正样本的过程。与许多先前工作不同,我们考虑一个现实场景,其中标签分配的概率(即倾向得分)是实例依赖的。在我们的方法中,我们研究了一个联合风险的经验对应项的最小化器,该风险依赖于正类包含的后验概率以及倾向得分。非凸经验风险通过交替优化两个函数的参数来求解。在理论分析中,我们利用最近从经验过程理论推导的方法建立了最小化器的风险一致性。此外,重要的进展是提出了一种优化算法的新实现,其中顺序逼近无标记样本中的一组正观测值至关重要。这依赖于改进的“间谍”技术以及基于条件概率的阈值规则。在20个数据集上针对各种标记场景进行的实验表明,所提出的方法与基于倾向函数估计的最先进方法相比,性能相当或更有效。
引用
@article{arxiv.2312.16557,
title = {Joint empirical risk minimization for instance-dependent positive-unlabeled data},
author = {Wojciech Rejchel and Paweł Teisseyre and Jan Mielniczuk},
journal= {arXiv preprint arXiv:2312.16557},
year = {2023}
}