中文

从正 unlabeled 数据理解对比表征学习

机器学习 2025-04-11 v2 人工智能 计算机视觉与模式识别

摘要

预文本号不变表征学习(PIRL)后跟监督微调(SFT)已成为标注数据有限时的标准学习范式。我们将该方法扩展至正 unlabeled(PU)设置,即仅获得少量标记正例和包含正负样本的大规模 unlabeled 池。我们在两种情形下进行研究:(i) 无需访问类别先验;(ii) 先验已知或可估计。我们引入正 unlabeled 对比学习(puCL),一种无偏且降低方差的对比目标函数,通过谨慎地将标记正例的弱监督信息整合到对比损失中。当类别先验已知时,我们提出正 unlabeled InfoNCE(puNCE),一种先验感知的扩展,重新加权 unlabeled 样本作为软正负混合样本。对于下游分类,我们开发了一种利用所学习嵌入空间结构的伪标签算法,采用PU感知聚类。我们的框架得到理论支持,提供偏差-方差分析、收敛性分析以及通过数据增强浓度实现的泛化保证;并通过标准PU基准数据集进行实证验证,结果显示我们的方法在低监督 regime下均优于现有方法,尤其在标注数据稀缺时效果显著。

关键词

引用

@article{arxiv.2402.06038,
  title  = {Understanding Contrastive Representation Learning from Positive Unlabeled (PU) Data},
  author = {Anish Acharya and Li Jing and Bhargav Bhushanam and Dhruv Choudhary and Michael Rabbat and Sujay Sanghavi and Inderjit S Dhillon},
  journal= {arXiv preprint arXiv:2402.06038},
  year   = {2025}
}