对抗扰动输入表征的可视化
机器学习
2021-06-01 v1 人机交互
摘要
已有研究表明深度学习模型易受对抗攻击。我们试图进一步理解此类攻击对神经网络中间激活的影响。我们提出一种评估指标 POP-N,用于在可视化对抗扰动输入表征的背景下,对将数据投影到 N 维的有效性进行评分。我们在 CIFAR-10 上进行实验,比较多种降维算法在不同对抗攻击下的 POP-2 分数。最后,我们利用对应于高 POP-2 分数的二维数据生成示例可视化。
引用
@article{arxiv.2105.14116,
title = {Visualizing Representations of Adversarially Perturbed Inputs},
author = {Daniel Steinberg and Paul Munro},
journal= {arXiv preprint arXiv:2105.14116},
year = {2021}
}