用于实用黑盒攻击的无数据对抗扰动
计算机视觉与模式识别
2020-03-04 v1
摘要
神经网络易受对抗样本的攻击,对抗样本是精心构造以欺骗预训练模型的恶意输入。对抗样本常表现出黑盒攻击可迁移性,使得为某一模型构造的对抗样本能欺骗另一模型。然而,现有黑盒攻击方法需要来自训练数据分布的样本以提升对抗样本跨模型的迁移性。由于数据依赖性,对抗扰动的欺骗能力仅在训练数据可访问时适用。本文提出一种无数据方法,用于在没有任何训练数据分布知识的情况下构造能欺骗目标模型的对抗扰动。在攻击者无法访问目标模型和训练数据的黑盒攻击实际场景中,我们的方法在目标模型上实现了高欺骗率,并优于其他通用对抗扰动方法。我们的方法通过实证表明,即便攻击者无法访问训练数据,当前深度学习模型仍处于风险中。
引用
@article{arxiv.2003.01295,
title = {Data-Free Adversarial Perturbations for Practical Black-Box Attack},
author = {ZhaoXin Huan and Yulong Wang and Xiaolu Zhang and Lin Shang and Chilin Fu and Jun Zhou},
journal= {arXiv preprint arXiv:2003.01295},
year = {2020}
}