经由解释质量实现公平性:评估事后解释质量中的差异
机器学习
2022-07-05 v2
摘要
随着事后解释方法日益被用于在高风险场景中解释复杂模型,确保所生成解释的质量在包括少数群体在内的各人口子群中持续保持高位变得至关重要。例如,不应出现属于特定性别子群(如女性)的实例所对应的解释不如其他性别的解释准确的情况。然而,极少乃至没有研究评估最先进解释方法输出的解释质量是否存在此类基于群体的差异。本工作中,我们着手研究识别解释质量中基于群体的差异,以填补上述空白。为此,我们首先概述构成解释质量且差异尤其成问题的关键属性。随后利用这些属性提出一种新颖的评估框架,可定量度量最先进方法输出解释质量中的差异。借助该框架,我们开展了严格的实证分析,以理解解释质量中基于群体的差异是否及何时出现。我们的结果表明,当被解释的模型复杂且高度非线性时,此类差异更可能出现。此外,我们还观察到某些事后解释方法(如 Integrated Gradients、SHAP)更可能表现出上述差异。据我们所知,本工作是首个突显并研究解释质量中基于群体差异问题的研究。由此,我们的工作揭示了解释方法在现实决策中可能引入不公平性的先前未探索的途径。
引用
@article{arxiv.2205.07277,
title = {Fairness via Explanation Quality: Evaluating Disparities in the Quality of Post hoc Explanations},
author = {Jessica Dai and Sohini Upadhyay and Ulrich Aivodji and Stephen H. Bach and Himabindu Lakkaraju},
journal= {arXiv preprint arXiv:2205.07277},
year = {2022}
}
备注
As presented at AIES 2022