贝叶斯逐层解释在对抗攻击下的鲁棒性
机器学习
2022-05-06 v3 机器学习
摘要
我们考虑分类任务中对抗攻击下神经网络预测的基于显著性的解释的稳定性问题。确定性神经网络的显著性解释即使在攻击失败(即未改变分类标签的攻击)时也极为脆弱。我们通过实验表明,贝叶斯神经网络提供的解释在输入对抗扰动下,甚至在对解释的直接攻击下,都明显更稳定。借助近期结果,我们还从数据流形几何的角度对这一结果给出了理论解释。此外,我们讨论了网络内部层中输入高层表示的解释的稳定性。我们的结果表明,贝叶斯方法除了对对抗攻击更具鲁棒性外,还有潜力为神经网络预测提供更稳定且可解释的评价。
引用
@article{arxiv.2102.11010,
title = {Resilience of Bayesian Layer-Wise Explanations under Adversarial Attacks},
author = {Ginevra Carbone and Guido Sanguinetti and Luca Bortolussi},
journal= {arXiv preprint arXiv:2102.11010},
year = {2022}
}