GK-SMOTE:一种无超参数、抗噪声的基于高斯核密度估计的过采样方法
机器学习
2025-09-16 v1
摘要
不平衡分类是机器学习中的重要挑战,尤其是在医疗诊断、欺诈检测和网络安全等关键应用中。传统的过采样技术,如 SMOTE,往往难以处理标签噪声和复杂的数据分布,导致分类准确率下降。本文提出了 GK-SMOTE,这是一种基于高斯核密度估计(Gaussian Kernel Density Estimation, KDE)的无超参数、抗噪声 SMOTE 扩展方法。GK-SMOTE 通过在高密度少数类区域生成合成样本来增强类别可分性,同时有效避免噪声或模糊区域。该自适应方法利用高斯 KDE 区分安全区域和噪声区域,确保在不需 extensive 参数调优的情况下生成更准确的样本。我们在多样化的二分类数据集上进行了广泛实验,结果表明 GK-SMOTE 在包括 MCC、Balanced Accuracy 和 AUPRC 在内的关键评估指标上均优于现有最先进的过采样技术。该方法为 noisy data 环境下的不平衡分类提供了一个稳健、高效的解决方案,在实际应用中具有很大的吸引力。
引用
@article{arxiv.2509.11163,
title = {GK-SMOTE: A Hyperparameter-free Noise-Resilient Gaussian KDE-Based Oversampling Approach},
author = {Mahabubur Rahman Miraj and Hongyu Huang and Ting Yang and Jinxue Zhao and Nankun Mu and Xinyu Lei},
journal= {arXiv preprint arXiv:2509.11163},
year = {2025}
}
备注
15 pages, 5 figures, 9th APWeb-WAIM joint International Conference on Web and Big Data (APWeb-WAIM 2025)