中文

函数式对抗攻击

机器学习 2019-10-30 v2 计算机视觉与模式识别

摘要

我们提出函数式对抗攻击,一类用于构造对抗样本以欺骗机器学习模型的新威胁模型。与标准的 p\ell_p 球威胁模型不同,函数式对抗威胁模型仅允许使用单一函数来扰动输入特征以产生对抗样本。例如,应用于图像颜色的函数式对抗攻击可将所有红色像素同时变为浅红色。这种图像中的全局均匀变化比单独扰动图像像素更不易察觉。为简便起见,我们将针对图像颜色的函数式对抗攻击称为 ReColorAdv,这也是我们实验的主要焦点。我们展示了函数式威胁模型可与现有的加性(p\ell_p)威胁模型结合,生成允许对输入进行小的个体扰动和大的均匀扰动的更强威胁模型。此外,我们证明此类组合包含了任一组成威胁模型所不允许的扰动。在实践中,ReColorAdv 可显著降低在 CIFAR-10 上训练的 ResNet-32 的准确率。此外,据我们所知,将 ReColorAdv 与其他攻击结合即使在对抗训练后也导致现有最强的攻击。ReColorAdv 的实现可在 https://github.com/cassidylaidlaw/ReColorAdv 获取。

关键词

引用

@article{arxiv.1906.00001,
  title  = {Functional Adversarial Attacks},
  author = {Cassidy Laidlaw and Soheil Feizi},
  journal= {arXiv preprint arXiv:1906.00001},
  year   = {2019}
}

备注

Accepted to NeurIPS 2019