中文

通过语义特征操控防御对抗攻击

机器学习 2020-04-23 v2 密码学与安全 机器学习

摘要

机器学习模型已被证明易受对抗攻击,更具体地说,易受对抗样本误分类的影响。在本文中,我们提出一种一次性且攻击无关的的特征操控(FM)-防御,以可解释且高效的方式检测和净化对抗样本。其直觉是,正常图像的分类结果通常对非显著内在特征变化具有抗性,例如手写数字笔画粗细的变化。相反,由于扰动缺乏可迁移性,对抗样本对此类变化敏感。为实现特征操控,应用组合变分自编码器来学习揭示语义特征的解耦潜在编码。通过对潜在编码进行变换与重构所产生的形变图像上分类变化的抗性,被用于检测可疑输入。此外,通过同时考虑类共享与类独有特征,组合-VAE 得到增强,以良好质量净化对抗样本。我们通过实验证明了检测的有效性与净化实例的质量。我们在三个数据集上的实验表明,FM-防御可检测由不同最先进(SOTA)对抗攻击生成的近 100%100\% 的对抗样本。它在接近正常样本流形的可疑实例上实现了超过 99%99\% 的整体净化准确率。

关键词

引用

@article{arxiv.2002.02007,
  title  = {Defending Adversarial Attacks via Semantic Feature Manipulation},
  author = {Shuo Wang and Tianle Chen and Surya Nepal and Carsten Rudolph and Marthie Grobler and Shangyu Chen},
  journal= {arXiv preprint arXiv:2002.02007},
  year   = {2020}
}

备注

arXiv admin note: text overlap with arXiv:2001.06640 and text overlap with arXiv:1705.09064 by other authors