中文

抗对抗攻击的鲁棒且信息论安全的偏置分类器

机器学习 2022-02-15 v2 密码学与安全 机器学习

摘要

本文引入偏置分类器,即使用以 Relu 为激活函数的 DNN 的偏置部分作为分类器。该工作的动机在于,偏置部分是零梯度的分段常数函数,因此无法被基于梯度的方法(如 FGSM)直接攻击以生成对抗样本。我们证明了偏置分类器的存在性,并给出了一种有效的训练方法。我们证明,通过向偏置分类器添加适当的随机一次项,可获得针对原模型梯度攻击的信息论安全分类器,其意义在于该攻击将生成完全随机的攻击方向。这似乎是首次提出信息论安全分类器的概念。我们提出了几种针对偏置分类器的攻击方法,并通过数值实验表明,在大多数情况下,偏置分类器比规模相近的 DNN 对这些攻击更具鲁棒性。

关键词

引用

@article{arxiv.2111.04404,
  title  = {Robust and Information-theoretically Safe Bias Classifier against Adversarial Attacks},
  author = {Lijia Yu and Xiao-Shan Gao},
  journal= {arXiv preprint arXiv:2111.04404},
  year   = {2022}
}