BASIL:面向类不平衡数据集的平衡主动半监督学习
机器学习
2022-03-14 v1
摘要
当前的半监督学习(SSL)方法假设在已标注和未标注数据集中每个类可用数据点的数量均衡。然而,大多数真实世界数据集天然存在类不平衡。已知在此类不平衡数据集上训练模型会导致有偏模型,进而引发对更频繁类的有偏预测。该问题在 SSL 方法中更为突出,因为它们会在训练期间使用该有偏模型获取伪标签(在未标注数据上)。本文中,我们通过尝试为 SSL 选取一个平衡的已标注数据集以得到无偏模型来解决此问题。不幸的是,从类不平衡分布中一次性获取平衡已标注数据集具有挑战性。我们提出 BASIL(Balanced Active Semi-supervIsed Learning,平衡主动半监督学习),一种以逐类方式优化子模互信息(SMI)函数、在主动学习循环中逐步选取平衡数据集的新算法。重要的是,我们的技术可有效用于提升任意 SSL 方法的性能。我们在 Path-MNIST 与 Organ-MNIST 医学数据集上针对多种 SSL 方法的实验显示了 Basil 的有效性。此外,我们观察到 Basil 优于最先进的基于多样性与不确定性的主动学习方法,因为 SMI 函数选取了更平衡的数据集。
引用
@article{arxiv.2203.05651,
title = {BASIL: Balanced Active Semi-supervised Learning for Class Imbalanced Datasets},
author = {Suraj Kothawade and Pavan Kumar Reddy and Ganesh Ramakrishnan and Rishabh Iyer},
journal= {arXiv preprint arXiv:2203.05651},
year = {2022}
}