中文

赔率真的奇怪吗?绕过对抗样本的统计检测

机器学习 2019-07-30 v1 密码学与安全 机器学习

摘要

已知深度学习分类器易受对抗样本攻击。ICML 2019上发表的一篇近期论文提出了一种统计检验检测方法,其基于含噪对抗样本的对数几率偏向真实类的观测。该方法在CIFAR-10数据集上评估,显示仅在1%假阳性率(FPR)下达到99%真阳性率(TPR)。本文中,我们首先开发了该统计检验方法的基于分类器的适配,并表明其提升了检测性能。随后我们提出Logit Mimicry Attack方法以生成对抗样本,使其对数几率模仿良性图像者。我们表明我们的攻击绕过了统计检验与基于分类器的方法,即使在5% FPR下也将它们的TPR分别降至低于2.2%和1.6%。我们最后表明,用模仿对抗样本的对数几率训练的基于分类器的检测器可被专门瞄准该检测器的自适应攻击者规避。此外,即便是迭代训练以防御自适应攻击者的检测器也无法变得鲁棒,表明对数几率的统计不能用于检测对抗样本。

关键词

引用

@article{arxiv.1907.12138,
  title  = {Are Odds Really Odd? Bypassing Statistical Detection of Adversarial Examples},
  author = {Hossein Hosseini and Sreeram Kannan and Radha Poovendran},
  journal= {arXiv preprint arXiv:1907.12138},
  year   = {2019}
}