利用输出洗牌攻击欺骗SHAP
等离子体物理
2024-08-14 v1
摘要
可解释人工智能(XAI)方法(如SHAP)有助于发现黑盒模型中的特征归因。如果该方法揭示了“受保护特征”(如性别、种族)对模型输出的显著归因,则该模型被认为是不公平的。然而,对抗性攻击可以破坏XAI方法的检测。先前构建此类对抗性模型的方法需要访问底层数据分布,这在许多实际场景中可能无法实现。我们放宽了这一约束,并提出了一类新颖的攻击方法,称为洗牌攻击,这些方法无需数据。所提出的攻击策略可以调整任何训练好的机器学习模型,以欺骗基于Shapley值的解释。我们证明了Shapley值无法检测洗牌攻击。然而,估计Shapley值的算法,如线性SHAP和SHAP,可以以不同程度的有效性检测这些攻击。我们通过使用真实世界数据集比较线性SHAP和SHAP的性能,证明了攻击策略的有效性。
引用
@article{arxiv.2408.06508,
title = {The Kinetic Analogue of the Pressure-Strain Interaction},
author = {Sarah A. Conley and James Juno and Jason M. TenBarge and M. Hasan Barbhuiya and Paul A. Cassak and Gregory G. Howes and Emily Lichko},
journal= {arXiv preprint arXiv:2408.06508},
year = {2024}
}
备注
Submitted to Physics of Plasmas