中文

特征归因与反事实解释可被操纵

机器学习 2021-06-29 v2 密码学与安全

摘要

随着机器学习模型日益用于关键决策场景(如医疗、金融),开发解释模型预测的方法受到越来越多的重视。此类“解释”被用于理解并建立对模型的信任,是机器学习流程中的重要组成部分。尽管解释是这些系统中的关键一环,但关于它们如何易受对手操纵的了解甚少。在本文中,我们讨论两类广泛的解释如何易受操纵。我们展示对手如何设计有偏模型,将模型无关的特征归因方法(如 LIME 与 SHAP)以及在反事实搜索中爬山的反事实解释(如 Wachter 算法与 DiCE)操纵为“掩盖”模型偏差。这些漏洞使对手能够部署有偏模型,而解释却不会揭示该偏差,从而欺骗利益相关者信任模型。我们在包括 COMPAS 和 Communities & Crime 在内的真实世界数据集上评估了这些操纵,发现解释在实践中可被操纵。

关键词

引用

@article{arxiv.2106.12563,
  title  = {Feature Attributions and Counterfactual Explanations Can Be Manipulated},
  author = {Dylan Slack and Sophie Hilgard and Sameer Singh and Himabindu Lakkaraju},
  journal= {arXiv preprint arXiv:2106.12563},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:2106.02666