iHHO-SMOTe: 一种处理异常值和降低噪声以改善不平衡数据分类的净化方法
机器学习
2025-04-18 v1
摘要
不平衡数据集的分类仍然是机器学习中的重要挑战,尤其是在大数据场景下,实例在各类别间不均匀分布,导致类别不平衡问题影响分类器性能。虽然合成少数过采样技术 (Synthetic Minority Over-sampling Technique, SMOTE) 通过生成少数类的新实例来解决此挑战,但在创建新样本时会面临噪声和异常值的障碍。本文提出一种方法 iHHO-SMOTe,通过首先从数据中净化噪声点来克服 SMOTE 的局限性。该过程采用随机森林进行特征选择,以识别最有价值的特征,随后应用基于密度的空间聚类带噪声算法 (Density-Based Spatial Clustering of Applications with Noise, DBSCAN) 检测基于所选特征的异常值。随后删除少数类中的识别出的异常值,创建精炼后的数据集用于后续过采样,采用称为 iHHO-SMOTe 的混合方法。跨多个数据集的全面实验表明,该模型的性能卓越,AUC 分数超过 0.99,G-mean 分数高达 0.99 凸显其鲁棒性,F1 分数始终超过 0.967。这些发现总体表明,净化后的 iHHO-SMOTe 是处理不平衡数据集的强大竞争者,专注于降低噪声并处理异常值以提高分类模型性能。
引用
@article{arxiv.2504.12850,
title = {iHHO-SMOTe: A Cleansed Approach for Handling Outliers and Reducing Noise to Improve Imbalanced Data Classification},
author = {Khaled SH. Raslan and Almohammady S. Alsharkawy and K. R. Raslan},
journal= {arXiv preprint arXiv:2504.12850},
year = {2025}
}