中文

从多个无标签数据集进行二分类几乎无需监督

机器学习 2023-06-13 v1

摘要

在标注成本很高的情况下,利用大量监督数据训练分类器是昂贵甚至不可行的。利用较弱监督形式处理问题的显著进展是从多个无标签数据集进行二分类,这要求已知所有无标签数据集的精确类先验。然而,类先验的可用性在许多真实场景中是受限的。为解决此问题,我们提出求解一个新的问题设定,即仅已知类先验的一种成对数值关系下的多无标签数据集二分类(MU-OPPO),该设定知道多个无标签数据集中两个数据集的两个类先验概率的相对顺序(哪个无标签数据集具有更高比例的正例)。在 MU-OPPO 中,我们不需要所有无标签数据集的类先验,而仅要求存在一对无标签数据集,我们知道其中哪个具有更大的类先验。显然,这种监督形式更易获得,可使标注成本几乎为零。我们提出一种处理 MU-OPPO 问题的新框架,由四个顺序模块组成:(i) 伪标签分配;(ii) 置信样本收集;(iii) 类先验估计;(iv) 利用估计类先验训练分类器。理论上,我们分析了所提框架下估计类先验与真实类先验之间的差距。实证上,我们通过综合实验确认了框架的优越性。实验结果表明,我们的框架带来了更小的类先验估计误差和更好的二分类性能。

关键词

引用

@article{arxiv.2306.07036,
  title  = {Making Binary Classification from Multiple Unlabeled Datasets Almost Free of Supervision},
  author = {Yuhao Wu and Xiaobo Xia and Jun Yu and Bo Han and Gang Niu and Masashi Sugiyama and Tongliang Liu},
  journal= {arXiv preprint arXiv:2306.07036},
  year   = {2023}
}

备注

38 pages, 5 figures, 10 tables