PermuteAttack:机器学习信用评分卡的因果反事实解释
机器学习
2020-09-01 v2 机器学习
摘要
本文是一篇关于金融零售信用评分中所用机器学习(ML)模型验证与解释新方向及方法的札记。我们提出的框架受人工智能(AI)安全与对抗式 ML 领域启发,其中面对 ML 算法压倒性复杂度时对其性能进行认证的需求,催生了对模型架构选择、敏感性分析与压力测试等传统观念的反思。我们的观点是,脱离 AI 安全领域的对抗扰动现象具有纯粹的算法根源,并属于模型风险评估的范畴。我们提出了一种基于为表格数据生成的对抗式反事实样本的模型批评与解释框架。在此语境下,给定实例的反事实样本被定义为从估计数据分布中采样、且被模型区别对待的合成数据点。反事实样本可用于提供模型行为的黑盒实例级解释,以及研究模型性能退化的输入空间区域。对抗样本生成算法在图像与自然语言处理(NLP)领域已被广泛研究。然而,多数金融数据以表格形式呈现,对此类数据集直接套用现有技术会生成不真实的样本。本文中,我们提出一种能处理含离散与类别变量的表格数据的反事实样本生成方法。我们提出的算法使用基于遗传算法的无梯度优化,因此适用于任意分类模型。
引用
@article{arxiv.2008.10138,
title = {PermuteAttack: Counterfactual Explanation of Machine Learning Credit Scorecards},
author = {Masoud Hashemi and Ali Fathi},
journal= {arXiv preprint arXiv:2008.10138},
year = {2020}
}
备注
16 pages, 10 figures