欺骗 LIME 与 SHAP:对事后解释方法的对抗攻击
机器学习
2020-02-04 v2 人工智能
机器学习
摘要
随着机器学习黑盒日益部署于医疗健康和刑事司法等领域,构建以可解释方式解释这些黑盒的工具与技术日益受到重视。此类解释正被领域专家用来诊断黑盒的系统性错误与潜在偏差。在本文中,我们证明依赖于输入扰动的事后解释技术(如 LIME 和 SHAP)并不可靠。具体而言,我们提出一种新颖的脚手架技术,它通过允许对抗实体精心构造任意所需的解释,从而有效隐藏任何给定分类器的偏差。我们的方法可用于脚手架任何有偏分类器,使其在输入数据分布上的预测仍保持有偏,但脚手架后分类器的事后解释看起来无害。利用多个真实世界数据集(包括 COMPAS)的广泛评估,我们展示了我们框架构造的极度有偏(种族主义)分类器如何轻易欺骗 LIME 和 SHAP 等流行解释技术,使其生成不反映潜在偏差的无害解释。
引用
@article{arxiv.1911.02508,
title = {Fooling LIME and SHAP: Adversarial Attacks on Post hoc Explanation Methods},
author = {Dylan Slack and Sophie Hilgard and Emily Jia and Sameer Singh and Himabindu Lakkaraju},
journal= {arXiv preprint arXiv:1911.02508},
year = {2020}
}