中文

基于自监督嵌入的对抗攻击的样本高效检测与分类

密码学与安全 2021-09-01 v1 机器学习

摘要

深度模型的对抗鲁棒性对于确保其在真实世界环境中的安全部署至关重要,但大多数现代防御手段范围狭窄且代价高昂。本文提出一种自监督方法,基于在预训练自监督编码器嵌入上运行的线性模型,检测对抗攻击并将其分类至各自威胁模型。我们在实验中使用了 SimCLR 编码器,因为我们表明 SimCLR 嵌入距离是人类可感知性的良好代理,使其能一次性囊括多种威胁模型。我们称该方法为 SimCat,因其使用 SimCLR 编码器来捕获并分类各类对抗攻击,包括 L_p 与非 L_p 规避攻击,以及数据投毒。线性分类器的简单特性使我们的方法在时间与样本复杂度上均高效。例如,在 SVHN 上,仅使用五对由 PGD-L_inf 攻击计算的干净与对抗样本,SimCat 的检测准确率超过 85%。此外,在 ImageNet 上,仅使用每类威胁模型 25 个样本,SimCat 即可分类八种不同攻击类型,如 PGD-L_2、PGD-L_inf、CW-L_2、PPGD、LPA、StAdv、ReColor 与 JPEG-L_inf,准确率超过 40%。在 STL10 数据上,我们将 SimCat 用作针对投毒攻击(如 BP、CP、FC、CLBD、HTBD)的防御,在使用仅二十个总投毒样本训练时使成功率减半。我们发现检测器对未见威胁模型泛化良好。最后,我们研究了检测方法在自适应攻击下的性能,并通过对抗训练进一步提升其对此类攻击的鲁棒性。

关键词

引用

@article{arxiv.2108.13797,
  title  = {Sample Efficient Detection and Classification of Adversarial Attacks via Self-Supervised Embeddings},
  author = {Mazda Moayeri and Soheil Feizi},
  journal= {arXiv preprint arXiv:2108.13797},
  year   = {2021}
}

备注

Accepted to ICCV 2021