针对黑盒对抗攻击的边界防御
密码学与安全
2022-02-01 v1
摘要
黑盒对抗攻击通过重复查询的迭代优化生成对抗样本。防御深度神经网络免受此类攻击一直具有挑战性。本文提出一种高效的边界防御(BD)方法,该方法利用对抗优化常常需要分类边界上的样本这一事实来缓解黑盒攻击。我们的方法将低分类置信度的样本检测为边界样本,并向其logits添加加性高斯白噪声。理论上分析了该方法对深度网络分类准确率的影响。进行了大量实验,结果表明BD方法能够可靠地防御软标签和硬标签黑盒攻击。它优于一系列现有的防御方法。对于IMAGENET模型,当分类置信度小于0.3时,向logits添加标准差为0.1的零均值加性高斯白噪声,该防御将攻击成功率降低至几乎为0,同时将分类准确率下降限制在约1%以内。
引用
@article{arxiv.2201.13444,
title = {Boundary Defense Against Black-box Adversarial Attacks},
author = {Manjushree B. Aithal and Xiaohua Li},
journal= {arXiv preprint arXiv:2201.13444},
year = {2022}
}