中文

一种具有可调稀疏性与泛化性的黑盒对抗攻击策略及其在深度图像分类器上的应用

密码学与安全 2021-09-10 v3 机器学习 机器学习

摘要

为深度神经网络构造对抗扰动是一个重要的研究方向。迄今,利用白盒反馈制作依赖于图像的对抗扰动一直是此类对抗攻击的常态。然而,黑盒攻击对于实际应用更为实用。可跨多幅图像适用的通用扰动因其固有的泛化性正日益受到关注。亦有研究致力于将扰动限制于图像中的少数像素。这有助于保持与原图的视觉相似性,使此类攻击难以被检测。本文标志着一个重要步骤,其结合了上述所有研究方向。我们提出DEceit算法,仅利用目标网络的黑盒反馈来构造有效的通用像素受限扰动。我们使用ImageNet验证集在最先进的深度神经分类器上进行实证调研,将被扰动像素数从区区10像素变化至图像全部像素。我们发现,使用DEceit仅扰动图像中约10%的像素即可取得可观且高度可迁移的欺骗率,同时保持视觉质量。我们进一步证明DEceit亦可成功应用于依赖图像的攻击。在两套实验中,我们的表现均优于若干最先进方法。

关键词

引用

@article{arxiv.2004.13002,
  title  = {A Black-box Adversarial Attack Strategy with Adjustable Sparsity and Generalizability for Deep Image Classifiers},
  author = {Arka Ghosh and Sankha Subhra Mullick and Shounak Datta and Swagatam Das and Rammohan Mallipeddi and Asit Kr. Das},
  journal= {arXiv preprint arXiv:2004.13002},
  year   = {2021}
}