以隐蔽偏置采样愚弄 SHAP
机器学习
2023-03-06 v3
摘要
SHAP 解释旨在识别在某一特定输入相对于背景分布的模型预测差异中贡献最大的特征。近期研究表明,恶意对手可通过操纵使 SHAP 产生任意期望的解释。然而,现有攻击仅聚焦于改动黑盒模型本身。本文提出一类互补的攻击:保持模型不变,通过对用于近似关于背景分布期望的数据点进行隐蔽偏置采样来操纵 SHAP 解释。在公平性审计情境中,我们展示该攻击能在不被察觉的情况下,降低敏感特征在解释组间结果差异时的重要性。更确切地说,在真实数据集上的实验表明,该攻击可使敏感特征归因幅度相对降低多达 90%。这些结果凸显了 SHAP 解释的可操纵性,并提醒审计者对其持怀疑态度。
引用
@article{arxiv.2205.15419,
title = {Fool SHAP with Stealthily Biased Sampling},
author = {Gabriel Laberge and Ulrich Aïvodji and Satoshi Hara and Mario Marchand. and Foutse Khomh},
journal= {arXiv preprint arXiv:2205.15419},
year = {2023}
}