一种多方案且与分类器无关的面向不平衡数据集的过采样方法
机器学习
2021-07-16 v1 人工智能
摘要
在过去二十年中,已构建了超过85种过采样算法(多为SMOTE算法的扩展)以解决不平衡数据集问题。然而,先前研究已表明,不同过采样算法对不同分类器具有不同程度的效率。面对大量可用算法,很难为选定分类器确定一种过采样算法。在此,我们通过一种多方案且与分类器无关的过采样方法克服了该问题:ProWRAS(邻近加权随机仿射阴影采样)。ProWRAS集成了局部随机仿射阴影采样(LoRAS)算法与邻近加权合成过采样(ProWSyn)算法。通过控制合成样本的方差,以及少数类数据的邻近加权聚类系统,与通过建模少数类高维凸空间生成合成样本的算法相比,ProWRAS算法提升了性能。ProWRAS具有四种过采样方案,每种方案以独特方式对生成数据的方差进行建模。最重要的是,在恰当选择过采样方案时,ProWRAS的性能与所用分类器无关。我们在20个公开可用数据集上将新开发的ProWRAS算法与五种最先进过采样模型及四种不同分类器进行了基准测试。就F1-score和Kappa-score而言,ProWRAS以统计显著方式优于其他过采样算法。此外,我们引入了一种衡量分类器无关性的新指标I-score,并定量表明ProWRAS表现更优且与所用分类器无关。在实践中,ProWRAS根据所选分类器定制合成样本生成,从而减少了基准测试工作。
引用
@article{arxiv.2107.07349,
title = {A multi-schematic classifier-independent oversampling approach for imbalanced datasets},
author = {Saptarshi Bej and Kristian Schultz and Prashant Srivastava and Markus Wolfien and Olaf Wolkenhauer},
journal= {arXiv preprint arXiv:2107.07349},
year = {2021}
}
备注
12 tables, 6 figures