中文

NPL 数据集上的机器学习模型评估与特征重要性分析

机器学习 2022-09-21 v1 人工智能

摘要

预测个人不良贷款的概率对于银行降低信用风险并在放贷前做出正确决策具有至关重要且有益的作用。做出这些决策的趋势基于信用研究,并依据公认标准、贷款还款历史以及客户的人口统计数据。在这项工作中,我们评估了不同的机器学习模型(如 Random Forest、Decision tree、KNN、SVM 和 XGBoost)在埃塞俄比亚一家私人银行所提供数据集上的表现。此外,受该评估的启发,我们探索了不同的特征选择方法以指明对银行而言的重要特征。我们的结果表明,XGBoost 在 KMeans SMOTE 过采样数据上取得了最高的 F1 分数。我们还发现,在评估信用风险时,最重要的特征是申请人的年龄、就业年限和申请人的总收入,而非与抵押品相关的特征。

关键词

引用

@article{arxiv.2209.09638,
  title  = {Machine Learning Models Evaluation and Feature Importance Analysis on NPL Dataset},
  author = {Rufael Fekadu and Anteneh Getachew and Yishak Tadele and Nuredin Ali and Israel Goytom},
  journal= {arXiv preprint arXiv:2209.09638},
  year   = {2022}
}

备注

7 pages, 2 figures, Machine Learning for Development (ML4D) workshop at NeurIPS 2021