用于不平衡数据集学习的改进采样技术
摘要
本文展示了使用 stackingC 算法在九个不同数据集上构建的分类器的性能。每个数据集是通过对原始不平衡数据集应用一种采样技术生成的。本文提出了五种新的采样技术(即 SMOTERandRep、Lax Random Oversampling、Lax Random Undersampling、Combined-Lax Random Oversampling Undersampling 和 Combined-Lax Random Undersampling Oversampling),它们基于三种通常用作不平衡学习解决方案的采样技术(即 Random Undersampling、Random Oversampling 和 Synthetic Minority Oversampling Technique)。用于评估分类器性能的度量指标是 F-measure 和 G-mean。F-measure 决定分类器对每个类的性能,而 G-mean 衡量分类器的整体性能。使用 F-measure 的结果表明,对于未使用采样技术的数据,分类器性能仅对多数类良好。结果还表明,在八种采样技术中,RU 和 LRU 性能最差,而其他技术(即 RO、C-LRUO 和 C-LROU)仅在某些类上表现良好。在所有数据集中表现最好的技术是 SMOTE、SMOTERandRep 和 LRO,其最低 F-measure 值在 0.5 到 0.65 之间。使用 G-mean 的结果表明,达到最高 G-mean 值的过采样技术是 LRO (0.86),其次是 C-LROU (0.85),然后是 SMOTE (0.84),最后是 SMOTERandRep (0.83)。结合两个度量(F-measure 和 G-mean)的结果,只有三种采样技术被认为性能良好(即 LRO、SMOTE 和 SMOTERandRep)。
引用
@article{arxiv.1601.04756,
title = {Improved Sampling Techniques for Learning an Imbalanced Data Set},
author = {Maureen Lyndel C. Lauron and Jaderick P. Pabico},
journal= {arXiv preprint arXiv:1601.04756},
year = {2016}
}
备注
7 pages, 10 figures, 16th Philippine Computing Science Congress (PCSC 2016)