中文

理解(非)鲁棒特征解耦及低维与高维对抗攻击之间的关系

计算机视觉与模式识别 2020-04-07 v1

摘要

近期研究提出假设,认为神经网络的对抗脆弱性源于其过度使用训练数据中固有的“非鲁棒特征”。我们通过实验表明,对于PGD攻击,存在一个训练阶段,神经网络开始严重依赖非鲁棒特征来提升自然准确率。我们还提出了一种机制,通过在每个训练批次中混入一定量主要包含“鲁棒特征”的图像,来降低对PGD式攻击的脆弱性,并证明鲁棒准确率得到提升,而自然准确率并未受到实质性损害。我们展示了在“鲁棒特征”上训练能提升不同架构和不同攻击下的鲁棒准确率。最后,我们通过实验证明这些“鲁棒特征”不会诱导空间不变性。

关键词

引用

@article{arxiv.2004.01903,
  title  = {Understanding (Non-)Robust Feature Disentanglement and the Relationship Between Low- and High-Dimensional Adversarial Attacks},
  author = {Zuowen Wang and Leo Horne},
  journal= {arXiv preprint arXiv:2004.01903},
  year   = {2020}
}