中文

驳斥抽样偏差:信用评分模型训练与评估的框架

机器学习 2024-07-19 v1 机器学习

摘要

评分模型支持金融机构的决策。其估计和评估基于先前被接受的具有已知还款行为的申请人的数据。这导致抽样偏差:可用标签数据提供了候选借款人分布的部分图景,而模型正要对其进行评分。本文针对抽样偏差对模型训练和评估的负面影响展开论述。为改进评分卡训练,我们提出了一种知悉偏差的自学习方法——一种拒绝推断框架,通过推断所选被拒申请的标签来扩展偏差的训练数据。对于评分卡评估,我们提出了贝叶斯框架,将标准准确度度量扩展至偏差情境下,并提供可靠的未来评分卡性能估计。在合成数据和真实数据上的大量实验表明,我们的方案在预测性能和盈利性方面优于各种基准方法。通过敏感性分析,我们还识别出影响其性能的边界条件。值得注意的是,我们利用随机对照试验中的真实数据,对在代表真实借款人 population 的持留数据上 assessment 我们的新方法。我们的发现表明,拒绝推断是一个困难的问题,仅能在适度程度上提升评分卡性能。针对评分卡评估中的抽样偏差是一个更有前景的提升评分实践的途径。例如,我们的结果表明,在采用贝叶斯评估决定接受率时,可实现约八 percent的利润提升。

关键词

引用

@article{arxiv.2407.13009,
  title  = {Fighting Sampling Bias: A Framework for Training and Evaluating Credit Scoring Models},
  author = {Nikita Kozodoi and Stefan Lessmann and Morteza Alamgir and Luis Moreira-Matias and Konstantinos Papakonstantinou},
  journal= {arXiv preprint arXiv:2407.13009},
  year   = {2024}
}