中文

DI-AA:一种用于欺骗深度神经网络的可解释白盒攻击

机器学习 2021-10-15 v1 密码学与安全

摘要

在对抗样本策略领域,针对深度神经网络(DNN)的白盒对抗样本(AE)攻击比黑盒AE攻击具有更强的破坏能力。然而,几乎所有白盒方法都缺乏从DNN角度的解释。也就是说,攻击者并未从可解释特征的角度研究攻击,且这些方法很少考虑DNN实际学习了哪些特征。本文提出了一种可解释的白盒AE攻击方法DI-AA,该方法探索了深度泰勒分解的可解释方法在选取最具贡献特征中的应用,并采用logit输出和L_p范数的拉格朗日松弛优化来进一步减小扰动。我们在三个数据集上将DI-AA与六种基线攻击(包括当前最先进的AutoAttack攻击)进行了比较。实验结果表明,我们提出的方法能够:1)以相对较低的扰动攻击非鲁棒模型,其扰动接近或低于AutoAttack方法;2)以最高的成功率攻破TRADES对抗训练模型;3)在黑盒迁移攻击中,生成的AE能将鲁棒黑盒模型的鲁棒准确率降低16%至31%。

关键词

引用

@article{arxiv.2110.07305,
  title  = {DI-AA: An Interpretable White-box Attack for Fooling Deep Neural Networks},
  author = {Yixiang Wang and Jiqiang Liu and Xiaolin Chang and Jianhua Wang and Ricardo J. Rodríguez},
  journal= {arXiv preprint arXiv:2110.07305},
  year   = {2021}
}

备注

9 pages, 5 figures, 7 tables