通过输出噪声扰动缓解黑盒对抗攻击
密码学与安全
2021-10-01 v1 机器学习
摘要
在黑盒对抗攻击中,攻击者查询深度神经网络(DNN),利用输出重构梯度,然后迭代地优化对抗输入。本文研究向 DNN 输出添加白噪声以缓解此类攻击的方法,独特地聚焦于噪声水平与查询代价之间的权衡分析。攻击者的查询次数(QC)被数学推导为噪声标准差的函数。借助该结果,防御者可以方便地找到所需噪声水平,以在由 QC 指定的期望安全等级和有限的 DNN 性能损失下缓解攻击。我们的分析表明,所添加噪声被 DNN 输出的微小变化急剧放大,使得重构梯度具有极低信噪比(SNR)。添加标准差小于 0.01 的轻微白噪声,足以使 QC 提升多个数量级,且不引起任何可察觉的分类精度下降。我们的实验证明,该方法能在现实 QC 约束下有效缓解软标签与硬标签黑盒攻击。我们还表明该方法优于许多其他防御方法,且对攻击者的反制措施具有鲁棒性。
引用
@article{arxiv.2109.15160,
title = {Mitigating Black-Box Adversarial Attacks via Output Noise Perturbation},
author = {Manjushree B. Aithal and Xiaohua Li},
journal= {arXiv preprint arXiv:2109.15160},
year = {2021}
}