中文

深度网络中对抗样本与类流形邻近性的考察

机器学习 2022-04-13 v1 密码学与安全 计算机视觉与模式识别

摘要

深度神经网络在多个领域取得了卓越的性能。然而,经过恰当训练后,它们存在对抗样本(AEs)这一固有脆弱性。在这项工作中,我们通过分析对抗样本在隐藏层上的激活来揭示其内在表示。我们测试了各类对抗样本,每一类均使用特定的范数约束生成,这影响了它们的视觉外观并最终影响其在训练网络中的行为。我们在图像分类任务(MNIST 和 CIFAR-10)上的结果表明,在比较各类对抗样本在内在表示上距特定类流形的邻近性时,它们之间存在着质性差异。我们提出了两种可用于比较到类特定流形距离的方法,且不受网络各层维度变化的影响。利用这些方法,我们一致地确认部分对抗样本未必会脱离正确类别的流形邻近区域,即便在神经网络的最后隐藏层也是如此。接着,利用 UMAP 可视化技术,我们将类激活投影到二维空间。结果表明,单个对抗样本的激活与测试集的激活相互纠缠。然而,对于一组称为垃圾类的构造输入而言,这一情况并不成立。我们还通过软最近邻损失从数值上确认了对抗样本与测试集的纠缠。

关键词

引用

@article{arxiv.2204.05764,
  title  = {Examining the Proximity of Adversarial Examples to Class Manifolds in Deep Networks},
  author = {Štefan Pócoš and Iveta Bečková and Igor Farkaš},
  journal= {arXiv preprint arXiv:2204.05764},
  year   = {2022}
}