中文

正类无标记对比学习

机器学习 2024-04-01 v3 人工智能

摘要

在无标记数据上自监督预训练、继而在有标记数据上监督微调,是一种从有限标记样本中学习的流行范式。我们将此范式扩展至经典的正类无标记(PU)设定,其任务为仅给定少量标记正样本以及(通常)大量无标记样本(可能为正或负)来学习二分类器。我们首先提出将标准 infoNCE 系列对比损失简单扩展至 PU 设定,并展示其相较现有无监督与监督方法学习到更优表示。随后我们开发了一种简单方法,利用一种新的 PU 专用聚类方案对无标记样本进行伪标记;这些伪标记可用于训练最终(正类 vs. 负类)分类器。我们的方法在多个标准 PU 基准数据集上轻松超越最先进 PU 方法,且不需要任何类先验的先验知识(此为其他 PU 方法的常见假设)。我们还提供了动机源于我们方法的简单理论分析。

关键词

引用

@article{arxiv.2206.01206,
  title  = {Positive Unlabeled Contrastive Learning},
  author = {Anish Acharya and Sujay Sanghavi and Li Jing and Bhargav Bhushanam and Dhruv Choudhary and Michael Rabbat and Inderjit Dhillon},
  journal= {arXiv preprint arXiv:2206.01206},
  year   = {2024}
}