一种针对热力图解释对抗攻击的简单防御
机器学习
2020-07-14 v1 人工智能
机器学习
摘要
随着机器学习模型被用于更敏感的应用,我们依赖可解释性方法来证明分类未使用歧视性属性。一个潜在的担忧是所谓的“公平性清洗”——操纵模型以隐藏实际使用的特征,转而显示更无害的特征为重要特征。在我们的工作中,我们提出了一种针对此类神经网络对抗攻击的有效防御。通过对多种解释方法的简单聚合,网络对操纵变得鲁棒。即便攻击者确切知晓模型权重及所用解释方法,这一点也成立。
引用
@article{arxiv.2007.06381,
title = {A simple defense against adversarial attacks on heatmap explanations},
author = {Laura Rieger and Lars Kai Hansen},
journal= {arXiv preprint arXiv:2007.06381},
year = {2020}
}
备注
Accepted at 2020 Workshop on Human Interpretability in Machine Learning (WHI)