信用风险建模的信息论框架:统一行业实践与统计理论以构建公平且可解释的评分卡
机器学习
2025-09-15 v1 机器学习
摘要
信用风险建模广泛依赖证据权重和信息价值进行特征工程,并使用群体稳定性指数进行漂移监控,然而它们的理论基础仍然相互脱节。我们建立了一个统一的信息论框架,揭示了这些行业标准指标是经典信息散度的实例。具体而言,我们证明了 IV 精确等于在相同分箱上计算的优劣信用结果之间的 PSI(Jeffreys 散度)。通过对 WoE 转换应用 delta 方法,我们推导出了 IV 和 PSI 的标准误差,首次实现了正式的假设检验和概率公平性约束。我们将信用建模固有的性能-公平性权衡形式化为在最大化受保护属性的 IV 以获得预测能力的同时,最小化受保护属性的 IV。使用深度为 1 的 XGBoost 树桩进行自动分箱,我们比较了三种编码策略:独热编码的逻辑回归、WoE 转换和受约束的 XGBoost。所有方法均实现了相当的预测性能(AUC 0.82-0.84),表明有原则的、基于信息论的分箱比编码选择更为重要。混合整数规划在性能-公平性前沿追踪了具有不确定性量化的 Pareto 最优解。该框架弥合了理论与实践,为广泛使用的信用风险指标提供了首个严谨的统计基础,同时在受监管环境中提供了平衡准确性与公平性的有原则工具。
引用
@article{arxiv.2509.09855,
title = {An Information-Theoretic Framework for Credit Risk Modeling: Unifying Industry Practice with Statistical Theory for Fair and Interpretable Scorecards},
author = {Agus Sudjianto and Denis Burakov},
journal= {arXiv preprint arXiv:2509.09855},
year = {2025}
}