利用 Boruta 特征选择和 DBSCAN 算法结合不同重采样技术增强信用违约预测
机器学习
2025-09-25 v1 应用统计
摘要
本研究通过比较三种常用于解决信用违约情境中类别不平衡问题的技术——SMOTE、SMOTE-Tomek 和 ADASYN——来考察信用违约预测。认识到信用违约数据集通常呈偏态分布,违约者占比远小于非违约者,我们首先在不进行任何重采样的情况下评估机器学习(ML)模型在不平衡数据上的表现,以建立基线性能。除了朴素贝叶斯和 K 近邻(KNN)等传统分类器外,本研究还探讨了先进的集成提升算法——包括极端梯度提升(XGBoost)、AdaBoost、梯度提升机(GBM)和轻量梯度提升机(Light GBM)——在信用违约预测中的适用性,结合 Boruta 特征选择和基于 DBSCAN 的异常检测,分别在重采样前后进行。使用来自克利夫兰大学机器学习仓库的真实信用违约数据集构建 ML 分类器并测试其性能。选用的模型性能评估指标包括受试者工作特征曲线下面积(ROC-AUC)、精确率-召回率曲线下面积(PR-AUC)、G-mean 和 F1 分数。该实证研究的结果表明,Boruta+DBSCAN+SMOTE-Tomek+GBM 分类器在信用违约情境中优于其他 ML 模型(F1 分数:82.56%,G-mean:82.98%,ROC-AUC:90.90%,PR-AUC:91.85%)。这些发现为未来创建更具韧性和适应性的信用违约系统奠定了基础,这对于全球基于信用的交易持续增长至关重要。
引用
@article{arxiv.2509.19408,
title = {Enhancing Credit Default Prediction Using Boruta Feature Selection and DBSCAN Algorithm with Different Resampling Techniques},
author = {Obu-Amoah Ampomah and Edmund Agyemang and Kofi Acheampong and Louis Agyekum},
journal= {arXiv preprint arXiv:2509.19408},
year = {2025}
}
备注
16 pages, 8 figures and 5 tables