中文

利用显著性检测对抗扰动

机器学习 2018-03-26 v1 机器学习

摘要

本文提出了一种通过使用原始数据和显著性数据训练二元分类器来检测对抗样本的新方法。在图像分类模型中,显著性通过识别用于预测的重要像素,简单地解释了模型如何做出决策。产生错误分类输出的模型总是学习到错误的特征,并同样显示出错误的显著性。我们的方法在检测对抗扰动方面表现出良好的性能。我们定量评估了检测器的泛化能力,表明使用强对抗样本训练的检测器在弱对抗样本上表现良好。

关键词

引用

@article{arxiv.1803.08773,
  title  = {Detecting Adversarial Perturbations with Saliency},
  author = {Chiliang Zhang and Zhimou Yang and Zuochang Ye},
  journal= {arXiv preprint arXiv:1803.08773},
  year   = {2018}
}