中文

基于特征选择与贝叶斯超参数优化的XGBoost风险模型

机器学习 2019-01-25 v1 机器学习

摘要

本文旨在探索基于极端梯度提升(XGBoost)方法的模型用于业务风险分类。在模型训练期间同时考虑特征选择(FS)算法与超参数优化。应用五种最常用的FS方法,包括按基尼系数加权、按卡方加权、层次变量聚类、按相关性加权和按信息加权,以缓解冗余特征的影响。在XGBoost中应用两种超参数优化方法:随机搜索(RS)与贝叶斯树结构Parzen估计器(TPE)。不同FS与超参数优化方法对模型性能的影响通过Wilcoxon符号秩检验进行研究。XGBoost的性能根据10折交叉验证得到的分类准确率、曲线下面积(AUC)、召回率和F1分数,与传统的逻辑回归(LR)模型进行比较。结果表明:层次聚类是LR的最优FS方法,而按卡方加权在XGBoost中取得最佳性能。XGBoost中的TPE与RS优化均显著优于LR。TPE优化表现出相对于RS的优越性,因其获得了显著更高的准确率以及略高的AUC、召回率和F1分数。此外,带TPE调优的XGBoost比RS方法具有更低的变异性。最后,基于XGBoost的特征重要性排序增强了模型可解释性。因此,带有贝叶斯TPE超参数优化的XGBoost作为一种实用且强大的方法服务于业务风险建模。

关键词

引用

@article{arxiv.1901.08433,
  title  = {A XGBoost risk model via feature selection and Bayesian hyper-parameter optimization},
  author = {Yan Wang and Xuelei Sherry Ni},
  journal= {arXiv preprint arXiv:1901.08433},
  year   = {2019}
}

备注

Accepted by International Journal of Database Management Systems (IJDMS)