中文

对抗样本的主成分性质

机器学习 2019-12-10 v1 计算机视觉与模式识别 图像与视频处理 机器学习

摘要

用于图像分类的深度神经网络已被发现易受对抗样本的攻击,对抗样本由添加到良性图像上的亚感知噪声组成,可轻易欺骗训练好的神经网络,对其商业部署构成重大风险。在本工作中,我们通过各图像对其主成分贡献的视角来分析对抗样本,这不同于先前作者在整数据集上执行 PCA 的工作。我们研究了在 ImageNet 上训练的若干最先进深度神经网络以及针对每个网络的几种攻击。我们的结果通过实证表明,多种攻击下的对抗样本在其对神经网络输入的主成分贡献上具有相似性质。我们提出一种用于神经网络衡量其对抗样本鲁棒性的新度量,称为 (k,p) 点。我们利用该度量在独立于架构和攻击类型的情况下,对 ImageNet 上训练的模型实现了 93.36% 的对抗样本检测准确率。

关键词

引用

@article{arxiv.1912.03406,
  title  = {Principal Component Properties of Adversarial Samples},
  author = {Malhar Jere and Sandro Herbig and Christine Lind and Farinaz Koushanfar},
  journal= {arXiv preprint arXiv:1912.03406},
  year   = {2019}
}