基于可解释性与对抗式 SHAP 学习的公平性
机器学习
2020-06-29 v3 机器学习
摘要
理解和信任模型预测的公平性(尤其是在考虑非特权群体的结果时)对于机器学习系统的部署与采用至关重要。SHAP 值提供了解释模型预测与特征归因的统一框架,但并未直接解决公平性问题。在本文中,我们提出一种新的公平性定义,强调外部审计者与模型可解释性的作用。为满足该定义,我们开发了一种利用对抗代理模型的 SHAP 值构造正则化项来减轻模型偏见的框架。我们聚焦于具有单一非特权群体的二分类任务,并将我们的公平性可解释性约束与经典统计公平性度量相联系。我们使用梯度提升与自适应提升在以下数据上验证了我们的方法:一个合成数据集、UCI Adult(人口普查)数据集以及一个真实世界的信用评分数据集。所生成的模型更公平且性能良好。
引用
@article{arxiv.2003.05330,
title = {Fairness by Explicability and Adversarial SHAP Learning},
author = {James M. Hickey and Pietro G. Di Stefano and Vlasios Vasileiou},
journal= {arXiv preprint arXiv:2003.05330},
year = {2020}
}
备注
17 pages, 2 figures