基于对抗验证的信用评分中数据集偏移管理
机器学习
2021-12-21 v1
摘要
数据集偏移在信用评分场景中十分常见,训练数据分布与实际需要预测的数据之间的不一致很可能导致模型性能不佳。然而,当前大多数研究未考虑这一点,它们在训练模型时直接混合不同时间段的数据。这带来两个问题。首先,存在数据泄露风险,即利用未来数据预测过去。这会在离线验证中导致结果虚高,但在实际应用中结果不尽如人意。其次,不同时间段的宏观经济环境和风控策略可能不同,借款人的行为模式也可能发生变化。用过去数据训练的模型可能不适用于近期阶段。因此,我们提出一种基于对抗验证的方法来缓解信用评分场景中的数据集偏移问题。在该方法中,通过对抗验证选取与预测数据分布最接近的部分训练集样本进行交叉验证,以保证训练模型在预测样本上的泛化性能。此外,通过一种简单的拼接方法,将与测试数据分布不一致的训练数据样本也参与交叉验证的训练过程,从而充分利用所有数据并进一步提升模型性能。为验证所提方法的有效性,利用 Lending Club 提供的数据与几种其他数据划分方法进行了对比实验。实验结果证明了数据集偏移在信用评分领域的重要性以及所提方法的优越性。
引用
@article{arxiv.2112.10078,
title = {Managing dataset shift by adversarial validation for credit scoring},
author = {Hongyi Qian and Baohui Wang and Ping Ma and Lei Peng and Songfeng Gao and You Song},
journal= {arXiv preprint arXiv:2112.10078},
year = {2021}
}