中文

利用输出洗牌攻击欺骗SHAP

等离子体物理 2024-08-14 v1

摘要

可解释人工智能(XAI)方法(如SHAP)有助于发现黑盒模型中的特征归因。如果该方法揭示了“受保护特征”(如性别、种族)对模型输出的显著归因,则该模型被认为是不公平的。然而,对抗性攻击可以破坏XAI方法的检测。先前构建此类对抗性模型的方法需要访问底层数据分布,这在许多实际场景中可能无法实现。我们放宽了这一约束,并提出了一类新颖的攻击方法,称为洗牌攻击,这些方法无需数据。所提出的攻击策略可以调整任何训练好的机器学习模型,以欺骗基于Shapley值的解释。我们证明了Shapley值无法检测洗牌攻击。然而,估计Shapley值的算法,如线性SHAP和SHAP,可以以不同程度的有效性检测这些攻击。我们通过使用真实世界数据集比较线性SHAP和SHAP的性能,证明了攻击策略的有效性。

关键词

引用

@article{arxiv.2408.06508,
  title  = {The Kinetic Analogue of the Pressure-Strain Interaction},
  author = {Sarah A. Conley and James Juno and Jason M. TenBarge and M. Hasan Barbhuiya and Paul A. Cassak and Gregory G. Howes and Emily Lichko},
  journal= {arXiv preprint arXiv:2408.06508},
  year   = {2024}
}

备注

Submitted to Physics of Plasmas