中文

正负无标签学习算法的可达、真实且公平评估

机器学习 2026-02-24 v2

摘要

正负无标签(PU)学习是一种弱监督的二分类问题,即仅从正样本和未标记数据中学习二分类器,无法获取负样本数据。近年来,已开发出许多PU学习算法以提高模型性能。然而,实验设置高度不一致,导致难以确定哪种算法表现更好。本文提出了首个PU学习基准,以系统性方式比较PU学习算法。在我们的实现过程中,我们识别出影响PU学习算法真实性和公平性评估的细微但关键因素。一方面,许多PU学习算法依赖包含负样本的验证集进行模型选择。这在传统PU学习设置中不现实,即没有负样本可用。为处理此问题,我们系统性地调查了PU学习的模型选择准则。另一方面,PU学习涉及不同的问题设置及其相应的解答家族,即单样本和双样本设置。然而,现有评估协议严重偏向单样本设置,忽略了两者之间的显著差异。我们识别了单样本设置中未标记训练数据内部标签漂移问题,并提出一种简单而有效的校准方法,以确保在同一家族内部以及跨家族之间的公平比较。我们希望我们的框架将为未来提供一个可达、真实且公平的PU学习算法评估环境。

关键词

引用

@article{arxiv.2509.24228,
  title  = {Accessible, Realistic, and Fair Evaluation of Positive-Unlabeled Learning Algorithms},
  author = {Wei Wang and Dong-Dong Wu and Ming Li and Jingxiong Zhang and Gang Niu and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:2509.24228},
  year   = {2026}
}

备注

ICLR 2026