基于合成数据的信用评估模型隐私保护训练评估
风险管理
2023-01-04 v1 机器学习
社会与信息网络
摘要
信用评分模型是金融机构管理信用风险的主要工具。行为评分研究稀缺的原因在于数据难以获取。金融机构必须维护借款人信息的隐私与安全,这使其难以参与研究合作。在本工作中,我们提出一种方法,能够评估使用合成数据训练的模型在应用于真实世界数据时的性能。我们的结果表明,当属性数量增加时,合成数据的质量日益变差。然而,与用真实数据训练的模型相比,用合成数据训练的信用评估模型的 AUC 降低了 3%、KS 降低了 6%。这些结果具有显著影响,因为它们鼓励基于合成数据的信用风险研究,从而在保持借款人隐私的同时,解决迄今受信息可用性制约的问题。
引用
@article{arxiv.2301.01212,
title = {Assessment of creditworthiness models privacy-preserving training with synthetic data},
author = {Ricardo Muñoz-Cancino and Cristián Bravo and Sebastián A. Ríos and Manuel Graña},
journal= {arXiv preprint arXiv:2301.01212},
year = {2023}
}