一种用于不平衡数据集优化的新型重采样技术
机器学习
2021-01-01 v1 机器学习
摘要
尽管数据量巨大,感兴趣的特殊事件仍可能十分稀少。稀有事件分类是许多领域的常见问题,如欺诈交易、恶意软件流量分析与网络入侵检测。已有诸多研究使用机器学习方法在各种数据集上开发恶意软件检测,但据我们所知,仅有 MTA-KDD'19 数据集具有每日更新恶意流量代表集的特性。这种每日更新是数据集的附加值,但由于类不平衡问题,它会转化为 RRw-Optimized MTA-KDD'19 将出现的潜在隐患。我们通过考虑四类少数类样本:安全、边界、稀有与离群点,来刻画真实数据集中的类分布困难。本工作中,我们开发了两种生成式轮廓重采样 1-最近邻(G1Nos)过采样算法以处理类不平衡问题。G1Nos 算法的第一模块执行基于系数的样本选择轮廓,识别不平衡度(ID)的临界阈值;第二模块使用类 SMOTE 的过采样算法生成合成样本。类的平衡由我们的 G1Nos 算法完成,以重建所用数据集两类间的比例。实验结果表明,在所有考量指标上,我们的过采样算法均优于其他两种 SOTA 方法。
引用
@article{arxiv.2012.15231,
title = {A Novel Resampling Technique for Imbalanced Dataset Optimization},
author = {Ivan Letteri and Antonio Di Cecco and Abeer Dyoub and Giuseppe Della Penna},
journal= {arXiv preprint arXiv:2012.15231},
year = {2021}
}