中文

语义对抗攻击:误导深度分类器的参数化变换

计算机视觉与模式识别 2019-08-19 v2 机器学习

摘要

深度神经网络已被证明对带有不可感知扰动的对抗性输入图像表现出一种引人关注的脆弱性。然而,大多数对抗攻击都假设对图像像素空间具有全局的、细粒度的控制。在本文中,我们考虑一种不同的设定:如果 adversary(对抗者)只能改变输入图像的特定属性,会发生什么?这些将生成可能感知上不同、但看起来自然且足以误导分类器的输入。我们提出了一种新方法,通过在参数化条件生成模型的值域空间上优化特定的对抗损失来生成此类“语义”对抗样本。我们在基于人脸图像训练的二分类器上展示了我们攻击的实现,并表明此类自然外观的语义对抗样本是存在的。我们在合成数据和真实数据上评估了攻击的有效性,并与现有攻击方法进行了详细比较。我们以理论界补充了经验结果,证明了此类参数化对抗样本的存在性。

关键词

引用

@article{arxiv.1904.08489,
  title  = {Semantic Adversarial Attacks: Parametric Transformations That Fool Deep Classifiers},
  author = {Ameya Joshi and Amitangshu Mukherjee and Soumik Sarkar and Chinmay Hegde},
  journal= {arXiv preprint arXiv:1904.08489},
  year   = {2019}
}

备注

Accepted to International Conference on Computer Vision, (ICCV) 2019