中文

利用重采样、正则化与模型集成算法预测类不平衡业务风险

机器学习 2019-03-14 v1 机器学习

摘要

我们旨在通过联合使用恰当的评估准则、重采样、交叉验证、分类器正则化与集成技术,开发并改进不平衡业务风险建模。基于10折交叉验证,采用受试者工作特征曲线下面积(ROC的AUC)进行模型比较。应用了两种欠采样策略(包括随机欠采样(RUS)与聚类质心欠采样(CCUS))以及两种过采样方法(包括随机过采样(ROS)与合成少数类过采样技术(SMOTE))。实现了三种高度可解释的分类器,包括无正则化逻辑回归(LR)、L1正则化LR(L1LR)与决策树(DT)。将两种集成技术(包括Bagging与Boosting)应用于DT分类器以进一步改进模型。结果表明,利用经SMOTE生成的含50%正例的过采样数据对DT进行Boosting为最优模型,其AUC、召回率与F1分数分别可达0.8633、0.9260与0.8907。

关键词

引用

@article{arxiv.1903.05535,
  title  = {Predicting class-imbalanced business risk using resampling, regularization, and model ensembling algorithms},
  author = {Yan Wang and Xuelei Sherry Ni},
  journal= {arXiv preprint arXiv:1903.05535},
  year   = {2019}
}