对抗攻击引起的表示偏差
机器学习
2022-11-08 v1
摘要
深度学习一直是一个热门话题,并在许多领域取得了成功。它引起了研究人员和机器学习从业者的关注,所开发的模型被部署到各种场景中。伴随其成就,研究表明深度学习模型易受对抗攻击。这一发现带来了研究的新方向,即开发算法来攻击和防御脆弱的网络。我们的兴趣在于理解这些攻击如何对深度学习模型的中间表示产生影响。我们提出了一种测量和分析对抗攻击所引起表示偏差的方法,在选定的一组层上逐步进行。实验使用多种攻击算法在CIFAR-10数据集上进行,并绘制图表以可视化对抗攻击在网络不同层中的影响。
引用
@article{arxiv.2211.03714,
title = {Deviations in Representations Induced by Adversarial Attacks},
author = {Daniel Steinberg and Paul Munro},
journal= {arXiv preprint arXiv:2211.03714},
year = {2022}
}