随机替代训练:一种针对梯度混淆防御生成对抗样本的灰盒方法
机器学习
2018-10-25 v1 人工智能
密码学与安全
机器学习
摘要
已有研究表明,攻击者可以构造与合法输入相似但被刻意设计以使神经网络误分类输入的样本。这些对抗样本是通过,例如,计算精心定义的损失函数关于输入的梯度来构造的。作为一种对策,一些研究者试图通过阻断或混淆梯度来设计鲁棒模型,即使在白盒设置下也是如此。另一类研究提出引入独立的检测器来尝试检测对抗样本。这种方法也利用了梯度混淆技术,例如,以防止攻击者试图欺骗检测器。在本文中,我们引入随机替代训练,一种可以针对混淆梯度的防御生成对抗样本的灰盒方法。对于那些试图使模型更鲁棒的防御,使用我们的技术,攻击者可以在不了解该防御的情况下生成对抗样本。对于那些试图检测对抗样本的防御,使用我们的技术,攻击者仅需关于该防御的非常有限的信息即可生成对抗样本。我们通过对两种使模型更鲁棒的防御和两种检测对抗样本的防御应用我们的技术来演示该方法。
引用
@article{arxiv.1810.10031,
title = {Stochastic Substitute Training: A Gray-box Approach to Craft Adversarial Examples Against Gradient Obfuscation Defenses},
author = {Mohammad Hashemi and Greg Cusack and Eric Keller},
journal= {arXiv preprint arXiv:1810.10031},
year = {2018}
}
备注
Accepted by AISec '18: 11th ACM Workshop on Artificial Intelligence and Security. Source code at https://github.com/S-Mohammad-Hashemi/SST