中文

特征选择与数据重采样在不平衡分类中联合影响的实证研究

机器学习 2021-09-14 v2 人工智能 计算机视觉与模式识别

摘要

在预测任务中,现实世界的数据集常呈现不同程度的不平衡(即长尾或偏斜)分布。虽然多数类(头部)具有充足样本,但少数类(尾部)可能仅由相当有限的样本所代表。数据预处理已被证明对处理此类问题非常有效。一方面,数据重采样是应对类不平衡的常用方法。另一方面,降维(缩减特征空间)是减少数据集中噪声与不一致性的常规技术。然而,特征选择与数据重采样在高性能不平衡分类中的可能协同作用此前很少被研究。为解决此问题,我们对特征选择与重采样在两类别不平衡分类中的联合影响进行了全面的实证研究。具体而言,我们通过在数据重采样之前或之后应用特征选择,研究了两种相反流水线的性能。我们在 52 个公开可用数据集上进行了大量实验,共计 9225 次测试,使用了 9 种特征选择方法、6 种用于类不平衡学习的重采样方法以及 3 种知名分类算法。实验结果表明,两种流水线之间不存在恒定的胜者;因此应同时考虑二者以推导出性能最佳的不平衡分类模型。我们发现,不平衡分类模型的性能不仅取决于所采用的分类器以及多数类与少数类样本数之比,还取决于样本数与特征数之比。总体而言,本研究应为不平衡学习领域的研究人员与从业者提供新的参考价值。

关键词

引用

@article{arxiv.2109.00201,
  title  = {An Empirical Study on the Joint Impact of Feature Selection and Data Re-sampling on Imbalance Classification},
  author = {Chongsheng Zhang and Paolo Soda and Jingjun Bi and Gaojuan Fan and George Almpanidis and Salvador Garcia},
  journal= {arXiv preprint arXiv:2109.00201},
  year   = {2021}
}

备注

25 pages, 12 figures; revision v1