中文

正样本-未标记学习的噪声对鲁棒表征对齐

机器学习 2026-02-11 v2 人工智能

摘要

正样本-未标记(PU)学习旨在训练一个二分类器(正样本 vs. 负样本),其中仅有有限的正样本数据和大量未标记数据可用。虽然应用广泛,但最先进的 PU 学习方法在复杂数据集上表现显著不如其监督学习对应方法,特别是在没有辅助负样本或预估计参数的情况下(例如在 CIFAR-100 数据集上差距达 14.26%)。我们识别出主要瓶颈是在不可靠监督下学习判别性表征的挑战。为应对这一挑战,我们提出 NcPU,一个无需辅助信息的非对比 PU 学习框架。NcPU 将一种噪声对鲁棒的监督非对比损失(NoiSNCL)与一种幻影标签消歧(PLD)方案相结合,后者通过基于遗憾的标签更新提供保守的负样本监督。理论上,NoiSNCL 和 PLD 可以从期望最大化框架的角度迭代地相互受益。经验上,大量实验表明:(1)NoiSNCL 使简单的 PU 方法能够达到竞争性性能;(2)NcPU 在多样化数据集上超越了最先进的 PU 方法,包括具有挑战性的灾后建筑损坏映射数据集,突显了其在实际应用中的前景。代码:代码将在审核后开源。

关键词

引用

@article{arxiv.2510.01278,
  title  = {Noisy-Pair Robust Representation Alignment for Positive-Unlabeled Learning},
  author = {Hengwei Zhao and Zhengzhong Tu and Zhuo Zheng and Wei Wang and Junjue Wang and Rusty Feagin and Wenzhe Jiao},
  journal= {arXiv preprint arXiv:2510.01278},
  year   = {2026}
}

备注

Published at ICLR 2026