中文

基于合成数据的信用评估模型隐私保护训练评估

风险管理 2023-01-04 v1 机器学习 社会与信息网络

摘要

信用评分模型是金融机构管理信用风险的主要工具。行为评分研究稀缺的原因在于数据难以获取。金融机构必须维护借款人信息的隐私与安全,这使其难以参与研究合作。在本工作中,我们提出一种方法,能够评估使用合成数据训练的模型在应用于真实世界数据时的性能。我们的结果表明,当属性数量增加时,合成数据的质量日益变差。然而,与用真实数据训练的模型相比,用合成数据训练的信用评估模型的 AUC 降低了 3%、KS 降低了 6%。这些结果具有显著影响,因为它们鼓励基于合成数据的信用风险研究,从而在保持借款人隐私的同时,解决迄今受信息可用性制约的问题。

关键词

引用

@article{arxiv.2301.01212,
  title  = {Assessment of creditworthiness models privacy-preserving training with synthetic data},
  author = {Ricardo Muñoz-Cancino and Cristián Bravo and Sebastián A. Ríos and Manuel Graña},
  journal= {arXiv preprint arXiv:2301.01212},
  year   = {2023}
}