正样本-未标记学习的噪声对鲁棒表征对齐
机器学习
2026-02-11 v2 人工智能
摘要
正样本-未标记(PU)学习旨在训练一个二分类器(正样本 vs. 负样本),其中仅有有限的正样本数据和大量未标记数据可用。虽然应用广泛,但最先进的 PU 学习方法在复杂数据集上表现显著不如其监督学习对应方法,特别是在没有辅助负样本或预估计参数的情况下(例如在 CIFAR-100 数据集上差距达 14.26%)。我们识别出主要瓶颈是在不可靠监督下学习判别性表征的挑战。为应对这一挑战,我们提出 NcPU,一个无需辅助信息的非对比 PU 学习框架。NcPU 将一种噪声对鲁棒的监督非对比损失(NoiSNCL)与一种幻影标签消歧(PLD)方案相结合,后者通过基于遗憾的标签更新提供保守的负样本监督。理论上,NoiSNCL 和 PLD 可以从期望最大化框架的角度迭代地相互受益。经验上,大量实验表明:(1)NoiSNCL 使简单的 PU 方法能够达到竞争性性能;(2)NcPU 在多样化数据集上超越了最先进的 PU 方法,包括具有挑战性的灾后建筑损坏映射数据集,突显了其在实际应用中的前景。代码:代码将在审核后开源。
引用
@article{arxiv.2510.01278,
title = {Noisy-Pair Robust Representation Alignment for Positive-Unlabeled Learning},
author = {Hengwei Zhao and Zhengzhong Tu and Zhuo Zheng and Wei Wang and Junjue Wang and Rusty Feagin and Wenzhe Jiao},
journal= {arXiv preprint arXiv:2510.01278},
year = {2026}
}
备注
Published at ICLR 2026