D-square-B:面向自然外观对抗攻击的深度分布界限
机器学习
2021-01-19 v2 机器学习
摘要
我们提出了一种新技术,通过分布分位数界限和多项式障碍损失函数,限制某些深层内部激活值的变化,从而生成外观自然的对抗样本。通过限制模型内部而非单个像素,我们的攻击允许扰动与原始输入的现有特征紧密耦合,使得生成的样本外观自然,同时与原始输入具有多样化且通常较大的像素距离。强制执行逐神经元分布分位数界限可以解决内部激活值的非均匀性问题。我们在 ImageNet 和五种不同模型架构上的评估表明,我们的攻击非常有效。与最先进的像素空间攻击、语义攻击和特征空间攻击相比,我们的攻击可以在达到相同攻击成功率/置信度的同时,产生外观自然得多的对抗扰动。这些扰动依附于现有的局部特征,并且没有任何固定的像素界限。
引用
@article{arxiv.2006.07258,
title = {D-square-B: Deep Distribution Bound for Natural-looking Adversarial Attack},
author = {Qiuling Xu and Guanhong Tao and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2006.07258},
year = {2021}
}