中文

在选择偏差下进行正 unlabeled 数据的增强预测

机器学习 2024-07-16 v1 机器学习

摘要

我们提出一种新的观察设定,用于正 unlabeled(PU)数据,在预测时观察值也被标记。这在实际中很常见——我们认为额外信息对预测至关重要,称此任务为"增强 PU 预测"。我们允许标记依赖于特征。在此情境下,建立了贝叶斯分类器及其风险,并与仅基于预测器的无标签数据分类器风险进行比较。我们引入了几种针对此情境的经验贝叶斯规则变体,并研究其性能。我们强调在增强 PU 情境下应用经典分类规则的危险性(以及容易性)——由于缺乏此类研究,无知的研究者容易扭曲所获预测。我们得出结论,基于最近提出的专为 PU 情境设计的变分自编码器(VAE)的变体在准确率上与其他所考虑的变体相当或更好,并且在无标签样本方面优于基于特征的 only 方法。

关键词

引用

@article{arxiv.2407.10309,
  title  = {Augmented prediction of a true class for Positive Unlabeled data under selection bias},
  author = {Jan Mielniczuk and Adam Wawrzeńczyk},
  journal= {arXiv preprint arXiv:2407.10309},
  year   = {2024}
}