面向不平衡半监督学习的伪标签分布对齐精炼
机器学习
2021-09-14 v2 机器学习
摘要
尽管半监督学习(SSL)已被证明是在标注数据稀缺时利用未标注数据的一种有前景的方法,现有的SSL算法通常假设训练类别分布是平衡的。然而,这些在类别分布不平衡下训练的SSL算法在泛化到平衡测试准则时会严重受损,因为它们利用了未标注数据偏向于多数类的有偏伪标签。为缓解此问题,我们构建一个凸优化问题以软精炼由有偏模型生成的伪标签,并开发了一个简单算法,称为伪标签分布对齐精炼(DARP),可证明且高效地求解该问题。在各种类别不平衡半监督场景下,我们展示了DARP的有效性及其与最先进SSL方案的兼容性。
引用
@article{arxiv.2007.08844,
title = {Distribution Aligning Refinery of Pseudo-label for Imbalanced Semi-supervised Learning},
author = {Jaehyung Kim and Youngbum Hur and Sejun Park and Eunho Yang and Sung Ju Hwang and Jinwoo Shin},
journal= {arXiv preprint arXiv:2007.08844},
year = {2021}
}
备注
19 pages; NeurIPS 2020