联邦学习方法下数据不平衡对信用风险预测的影响
机器学习
2024-01-17 v1 人工智能
摘要
信用风险预测对于商业银行和其他金融机构向客户发放贷款并最小化潜在损失至关重要。然而,传统的机器学习方法需要将敏感的客户信息共享给外部服务器以构建全局模型,这可能带来安全威胁和隐私泄露的风险。一种新开发的隐私保护分布式机器学习技术——联邦学习(FL),允许在不直接访问私有本地数据的情况下训练全局模型。本研究考察了联邦学习在信用风险评估中的可行性,并展示了数据不平衡对模型性能的影响。我们探索了两种神经网络架构——多层感知器(MLP)和长短期记忆网络(LSTM),以及一种树集成架构——极端梯度提升(XGBoost),在三种不同数据集上,涉及不同客户端数量和数据分布配置的各种场景。我们证明,联邦模型在数据量较小的非主导客户端上始终优于本地模型。这种趋势在高度不平衡的数据场景中尤为明显,模型性能平均提高了17.92%。然而,对于主导客户端(拥有更多数据的客户端),联邦模型可能不表现出优越性能,这表明需要为此类客户端提供特殊激励以鼓励其参与。
引用
@article{arxiv.2401.07234,
title = {The Effects of Data Imbalance Under a Federated Learning Approach for Credit Risk Forecasting},
author = {Shuyao Zhang and Jordan Tay and Pedro Baiz},
journal= {arXiv preprint arXiv:2401.07234},
year = {2024}
}