中文

一种针对热力图解释对抗攻击的简单防御

机器学习 2020-07-14 v1 人工智能 机器学习

摘要

随着机器学习模型被用于更敏感的应用,我们依赖可解释性方法来证明分类未使用歧视性属性。一个潜在的担忧是所谓的“公平性清洗”——操纵模型以隐藏实际使用的特征,转而显示更无害的特征为重要特征。在我们的工作中,我们提出了一种针对此类神经网络对抗攻击的有效防御。通过对多种解释方法的简单聚合,网络对操纵变得鲁棒。即便攻击者确切知晓模型权重及所用解释方法,这一点也成立。

关键词

引用

@article{arxiv.2007.06381,
  title  = {A simple defense against adversarial attacks on heatmap explanations},
  author = {Laura Rieger and Lars Kai Hansen},
  journal= {arXiv preprint arXiv:2007.06381},
  year   = {2020}
}

备注

Accepted at 2020 Workshop on Human Interpretability in Machine Learning (WHI)