中文

开放采样:探索分布外数据以重新平衡长尾数据集

机器学习 2022-07-06 v3 计算机视觉与模式识别

摘要

深度神经网络在训练数据集存在极端类别不平衡时通常表现不佳。近期研究发现,以半监督方式直接使用分布外数据(即开放集样本)进行训练会损害泛化性能。本工作中,我们从贝叶斯视角理论上证明分布外数据仍可用于增强少数类。基于这一动机,我们提出一种称为开放采样(Open-sampling)的新方法,利用开放集噪声标签来重新平衡训练数据集的类别先验。对于每个开放集实例,其标签从我们预定义的、与原始类别先验分布互补的分布中采样。我们通过实验表明,开放采样不仅重新平衡了类别先验,还鼓励神经网络学习可分离的表示。大量实验证明,我们提出的方法显著优于现有的数据重新平衡方法,并能提升现有最先进方法的性能。

关键词

引用

@article{arxiv.2206.08802,
  title  = {Open-Sampling: Exploring Out-of-Distribution data for Re-balancing Long-tailed datasets},
  author = {Hongxin Wei and Lue Tao and Renchunzi Xie and Lei Feng and Bo An},
  journal= {arXiv preprint arXiv:2206.08802},
  year   = {2022}
}

备注

Accepted by ICML 2022