中文

识别易受对抗攻击的类别

机器学习 2019-06-03 v1 密码学与安全 机器学习

摘要

尽管已有大量尝试来防御基于深度学习的图像分类器,它们仍然易受对抗攻击。本文提出一种技术来识别易受攻击的类别,即那些更容易被颠覆的类别。为识别易受攻击的类别,我们使用基于距离的度量并将其应用于训练好的模型。基于原始类别之间的距离,我们在原始类别与对抗类别之间建立映射,这在对抗环境下显著减少了模型的随机性。我们分析特征类别之间的高维几何结构,并识别出对抗攻击中 k 个最易受攻击的目标类别。我们使用 MNIST、Fashion MNIST、CIFAR-10(ImageNet 和 ResNet-32)数据集进行实验。最后,我们评估我们的技术,以确定哪种基于距离的度量效果最佳,以及模型的随机性如何随扰动变化。

关键词

引用

@article{arxiv.1905.13284,
  title  = {Identifying Classes Susceptible to Adversarial Attacks},
  author = {Rangeet Pan and Md Johirul Islam and Shibbir Ahmed and Hridesh Rajan},
  journal= {arXiv preprint arXiv:1905.13284},
  year   = {2019}
}