中文

输出随机化:一种针对白盒与黑盒对抗模型的新型防御

机器学习 2021-07-09 v1 密码学与安全

摘要

对抗样本在多种场景下对深度神经网络模型构成威胁,从 adversary 在“白盒”设定下完全掌握模型信息,到相反的“黑盒”设定。在本文中,我们探索使用输出随机化作为针对黑盒和白盒模型中攻击的防御,并提出了两种防御方法。在第一种防御中,我们提出在测试时输出随机化以挫败黑盒设定下的有限差分攻击。由于此类攻击依赖对模型的重复查询来估计梯度,我们研究了使用随机化来阻止此类 adversary 成功制造对抗样本。我们经验性地表明,该防御可将使用Zeroth Order Optimization攻击的黑盒 adversary 成功率限制为0%。其次,我们提出输出随机化训练作为针对白盒 adversary 的防御。与先前使用随机化的方法不同,我们的防御在测试时不需要使用随机化,从而消除了Backward Pass Differentiable Approximation攻击,该攻击已被证明对其他随机化防御有效。此外,该防御开销低且易于实现,使其能跨各种模型架构与其他防御结合使用。我们针对Projected Gradient Descent攻击者评估了输出随机化训练,并表明当使用交叉熵损失时,该防御可将PGD攻击成功率降至12%。

关键词

引用

@article{arxiv.2107.03806,
  title  = {Output Randomization: A Novel Defense for both White-box and Black-box Adversarial Models},
  author = {Daniel Park and Haidar Khan and Azer Khan and Alex Gittens and Bülent Yener},
  journal= {arXiv preprint arXiv:2107.03806},
  year   = {2021}
}

备注

This is a substantially changed version of an earlier preprint (arXiv:1905.09871)