面向半监督多标签学习的类分布感知伪标注
机器学习
2023-05-23 v2
摘要
伪标注已成为利用无标签数据的一种流行且有效的方法。然而,在半监督多标签学习(SSMLL)背景下,传统的伪标注方法在处理具有多个标签且标签数量未知的样本时遇到困难。这些局限常导致引入假阳性标签或忽略真阳性标签。为克服这些挑战,本文提出一种称为类感知伪标注(CAP)的新方案,以类感知的方式执行伪标注。所提方法引入了一个包含类感知阈值的规范化学习框架,有效控制在每个类上正负伪标签的分配。值得注意的是,即使在标记样本比例很小的情况下,我们的观察表明估计的类分布可作为可靠的近似。受此发现启发,我们开发了类分布感知阈值策略,以确保伪标签分布与真实分布对齐。估计类分布的正确性在理论上得到验证,并给出了所提方法的泛化误差界。在多个基准数据集上的大量实验证实了 CAP 在解决 SSMLL 问题挑战方面的有效性。
引用
@article{arxiv.2305.02795,
title = {Class-Distribution-Aware Pseudo Labeling for Semi-Supervised Multi-Label Learning},
author = {Ming-Kun Xie and Jia-Hao Xiao and Hao-Zhe Liu and Gang Niu and Masashi Sugiyama and Sheng-Jun Huang},
journal= {arXiv preprint arXiv:2305.02795},
year = {2023}
}