通用对抗扰动中主导类别的分析
机器学习
2021-01-12 v2
摘要
深度神经网络易被对抗样本欺骗的原因仍是一个开放性的讨论。确实,许多不同策略可用于高效生成对抗攻击,其中一些依赖于不同的理论依据。在这些策略中,通用(输入无关)扰动因其能够独立于所施加扰动的输入而欺骗网络而尤为引人关注。本文研究了通用扰动中一个先前文献已有报道但缺乏严格论证的引人注目现象:通用扰动将大多数输入的预测类别改变为某一个特定(主导)类别,即便在扰动生成过程中并未指定该行为。为解释此现象成因,我们提出若干假设,并以音频领域的语音命令分类问题为试验平台进行实验验证。我们的分析揭示了通用扰动的有趣性质,提出了生成此类攻击的新方法,并从几何与数据特征双视角对主导类别给出了解释。
引用
@article{arxiv.2012.14352,
title = {Analysis of Dominant Classes in Universal Adversarial Perturbations},
author = {Jon Vadillo and Roberto Santana and Jose A. Lozano},
journal= {arXiv preprint arXiv:2012.14352},
year = {2021}
}
备注
20 pages, 10 figures, 4 tables