中文

超越短视:通过整体预测趋势从正类与未标记数据中学习

机器学习 2024-10-14 v1 人工智能

摘要

从正类与未标记数据(PUL)中学习二分类器在许多现实应用中至关重要,尤其在难以验证负类样本时。尽管近期PUL方法经验性能令人印象深刻,但由于缺乏负标签,累积误差与估计偏差增大等挑战依然存在。在本文中,我们揭示了PUL中一个有趣却长期被忽视的现象:在每次训练迭代中对正类数据重采样以确保正类与未标记样本间平衡分布会带来强劲的早期阶段性能。此外,正类与负类的预测趋势呈现出明显不同的模式。具体而言,未标记负类样本的分数(输出概率)持续下降,而未标记正类样本的分数则大体呈现混沌趋势。我们创新性地采用整体方法,而非关注单个时间帧内的分类,将每个样本的分数解释为 temporal point process(TPP,时间点过程)。这将PUL的核心问题重新表述为识别这些分数中的趋势。随后我们提出一种受TPP启发的趋势检测新度量,并证明其在预测变化时的渐近无偏性。值得注意的是,我们的方法无需额外参数调优或先验假设即可完成PUL,为应对该问题提供了替代视角。大量实验验证了本方法的优越性,尤其在高度不平衡的真实世界设定中,其在关键指标上实现了高达11.3%的提升。代码见 https://github.com/wxr99/HolisticPU。

关键词

引用

@article{arxiv.2310.04078,
  title  = {Beyond Myopia: Learning from Positive and Unlabeled Data through Holistic Predictive Trends},
  author = {Xinrui Wang and Wenhai Wan and Chuanxin Geng and Shaoyuan LI and Songcan Chen},
  journal= {arXiv preprint arXiv:2310.04078},
  year   = {2024}
}

备注

25 pages