在监督学习中结合公平性与可解释性
机器学习
2023-04-24 v3 计算机与社会
摘要
辅助人类决策的机器学习算法可能无意中对某些受保护群体产生歧视。我们将直接歧视形式化为受保护属性对决策的直接因果效应,而将诱导歧视形式化为与受保护属性相关的非保护特征之因果影响的变化。边际直接效应(MDE)和SHapley Additive exPlanations(SHAP)的测量表明,最先进的公平学习方法在合成和真实世界数据集中可能通过关联或反向歧视诱导歧视。为抑制算法系统中的歧视,我们提议消除受保护属性对系统输出的影响,同时保留其余特征的影响。我们引入并研究了实现此类目标的后处理方法,发现它们能产生相对高的模型准确率、防止直接歧视,并减少各种差异度量,例如人口统计差异。
引用
@article{arxiv.2204.02947,
title = {Marrying Fairness and Explainability in Supervised Learning},
author = {Przemyslaw Grabowicz and Nicholas Perello and Aarshee Mishra},
journal= {arXiv preprint arXiv:2204.02947},
year = {2023}
}
备注
17 pages, 16 figures. Section 4.3 updated