中文

学习刻画对抗子空间

计算机视觉与模式识别 2019-11-18 v1

摘要

深度神经网络(DNNs)已知易受恶意生成的对抗样本攻击。为检测这些对抗样本,先前的方法使用人工设计的度量来刻画对抗样本所在的\textit{对抗子空间}的性质。然而,我们发现这些方法在实际攻击检测场景中并不奏效。因为人工定义的特征缺乏鲁棒性,且在区分能力上有限以检测强攻击。为解决此问题,我们提出了一种新颖的对抗检测方法,其通过自适应学习合理度量来刻画对抗子空间以识别对抗样本。作为辅助上下文信息,\textit{k} 最近邻被用于表示被检测样本周围的子空间。我们提出了一种称为邻居上下文编码器(NCE)的创新模型,从 \textit{k} 邻居上下文中学习并推断被检测样本是正常还是对抗的。我们在 CIFAR-10、CIFAR-100 和 ImageNet 数据集上进行了充分实验。结果表明我们的方法在三种设定下超越所有现有方法:\textit{攻击感知黑盒检测}、\textit{攻击无感知黑盒检测}和 \textit{白盒检测}。

关键词

引用

@article{arxiv.1911.06587,
  title  = {Learning To Characterize Adversarial Subspaces},
  author = {Xiaofeng Mao and Yuefeng Chen and Yuhong Li and Yuan He and Hui Xue},
  journal= {arXiv preprint arXiv:1911.06587},
  year   = {2019}
}

备注

Submitted to ICASSP 2020