中文

通过激活空间中空间行为检测对抗扰动

机器学习 2018-12-05 v2 计算机视觉与模式识别

摘要

基于神经网络的分类器仍易受到对抗扰动的操纵。最先进的攻击可以克服迄今为止大多数建议的防御或检测机制,在此军备竞赛中对手占据上风。对抗样本被设计成与其构造自的正常输入相似,同时触发错误分类。这一基本设计目标导致了在激活空间(Activation Spaces,由作者提出以指代由网络各层激活值构成的高维空间)语境下的特征性空间行为。在网络前几层的输出中,对抗样本可能类似于源类的正常实例,而在最后几层中此类样本会发散朝向对手的目标类。以下步骤使我们能够利用这种从一个类到另一个类的内在偏移,从而形成一种新颖的对抗样本检测器。我们由深度神经网络各层的激活值构建欧几里得空间。然后,利用非对抗样本,我们诱导出一组 k 近邻分类器(k-NN),每个神经网络层的每个激活空间各一个。我们利用这些分类器为每个未扰动输入样本生成类标签序列,并估计在 one 激活空间与另一个之间类标签改变的先验概率。在检测阶段,我们使用训练好的分类器为每个输入计算分类标签序列。然后我们估计这些分类序列的似然,并表明对抗序列远不如正常序列可能。我们针对最先进的 C&W 攻击方法评估了我们的检测方法,使用两个图像分类数据集(MNIST、CIFAR-10),在 CIFAR-10 数据集上达到了 0.95 的 AUC。

关键词

引用

@article{arxiv.1811.09043,
  title  = {Detecting Adversarial Perturbations Through Spatial Behavior in Activation Spaces},
  author = {Ziv Katzir and Yuval Elovici},
  journal= {arXiv preprint arXiv:1811.09043},
  year   = {2018}
}