深度学习中的可认证鲁棒解释
机器学习
2019-10-21 v3 机器学习
摘要
深度学习解释对于说明模型预测背后的推理至关重要。理解解释方法的鲁棒性十分重要,尤其在医疗应用等敏感领域,因为解释结果常被用于下游任务。尽管基于梯度的显著图是深度学习解释的流行方法,近期工作表明它们可能易受对抗攻击。在本文中,我们解决该问题并提供一种用于深度学习解释的可认证防御方法。我们证明,流行的SmoothGrad方法(其在输入的随机扰动上计算平均显著图)的一个稀疏化版本,对于对抗扰动是可认证鲁棒的。我们通过将近期针对可认证鲁棒平滑分类器的边界推广到解释设定而得到该结果。在ImageNet样本上的实验验证了我们的理论。
引用
@article{arxiv.1905.12105,
title = {Certifiably Robust Interpretation in Deep Learning},
author = {Alexander Levine and Sahil Singla and Soheil Feizi},
journal= {arXiv preprint arXiv:1905.12105},
year = {2019}
}