中文

特征选择与变换对机器学习方法确定信用评分的影响

风险管理 2023-03-10 v1 数理金融

摘要

银行将信用评分用作财务实力与信贷资格的重要指示。评分模型旨在分配统计赔率或概率,以预测是否存在不付款风险,并关联许多其他可能涉及的因素。本文旨在阐明八种机器学习(ML)方法(支持向量机、高斯朴素贝叶斯、决策树、随机森林、XGBoost、K 近邻、多层感知机神经网络)与逻辑回归在发现违约风险及其贡献特征方面的有益用途。我们从三方面进行了广泛比较:(i) 哪些带或不带自身包装器特征选择的 ML 模型表现最佳;(ii) 特征选择与适当数据缩放方法结合如何影响性能;(iii) 哪些最成功组合(算法、特征选择、缩放)给出最佳的验证指标,如准确率、I 类与 II 类错误以及 AUC。我们考量了关于德国与澳大利亚案例的开放获取信用评分违约风险数据集,据此确定了最佳方法、缩放及最能贡献违约风险的特征,并将我们的发现与文献中相关结果比较。我们阐明了相较于现有文献,选择方法与缩放对性能指标的正面贡献。

关键词

引用

@article{arxiv.2303.05427,
  title  = {The Impact of Feature Selection and Transformation on Machine Learning Methods in Determining the Credit Scoring},
  author = {Oguz Koc and Omur Ugur and A. Sevtap Kestel},
  journal= {arXiv preprint arXiv:2303.05427},
  year   = {2023}
}