中文

半监督学习中针对不平衡数据的迭代最近邻过采样

机器学习 2013-12-25 v1

摘要

基于图的直推式半监督学习方法通常利用有标签和无标签样本作为顶点构建无向图。这些方法通过边将有标签样本的标签信息传播给邻居,以获得无标签样本的预测标签。大多数流行的半监督学习方法对不平衡有标签数据集中出现的初始标签分布敏感。在不平衡分类中,类边界会被多数类严重扭曲。在本文中,我们提出了一种简单有效的方法,通过迭代选择少量无标签样本并将其加入少数类,从而形成平衡的有标签数据集,以供后续学习方法使用。在 UCI 数据集和 MNIST 手写数字数据集上的实验表明,所提出的方法优于其他现有的最先进方法。

关键词

引用

@article{arxiv.1312.6807,
  title  = {Iterative Nearest Neighborhood Oversampling in Semisupervised Learning from Imbalanced Data},
  author = {Fengqi Li and Chuang Yu and Nanhai Yang and Feng Xia and Guangming Li and Fatemeh Kaveh-Yazdy},
  journal= {arXiv preprint arXiv:1312.6807},
  year   = {2013}
}