可解释性即一种安全性:基于解释器的集成方法用于对抗攻击防御
机器学习
2023-04-17 v1 密码学与安全
计算机视觉与模式识别
摘要
深度神经网络(DNN)模型在丰富的现实应用中取得巨大成功的同时,长期以来因其对对抗攻击的脆弱性而受到批评。大量研究工作致力于缓解对抗攻击的威胁,但对抗样本的本质特征尚不清晰,且大多数现有方法仍易受混合攻击影响并遭受反攻击。有鉴于此,本文首先揭示了基于敏感性分析的 DNN 解释器与对抗样本生成过程之间的基于梯度的相关性,这指出了对抗攻击的阿喀琉斯之踵,并为联系 DNN 的两个长期挑战——脆弱性与不可解释性——提供了启示。我们随后提出一种称为 X-Ensemble 的基于解释器的集成框架,用于鲁棒的对抗防御。X-Ensemble 采用一种新颖的检测-校正流程,其特点在于针对目标分类器基于各类解释信息构建多个子检测器与一个校正器。此外,X-Ensemble 采用随机森林(RF)模型将子检测器组合为集成检测器以防御对抗混合攻击。RF 的不可微特性进一步使其成为抵御对抗者反攻击的宝贵选择。在各类最先进攻击与多种攻击场景下的广泛实验证明了 X-Ensemble 相对于竞争性基线方法的优势。
引用
@article{arxiv.2304.06919,
title = {Interpretability is a Kind of Safety: An Interpreter-based Ensemble for Adversary Defense},
author = {Jingyuan Wang and Yufan Wu and Mingxuan Li and Xin Lin and Junjie Wu and Chao Li},
journal= {arXiv preprint arXiv:2304.06919},
year = {2023}
}
备注
10 pages, accepted to KDD'20