中文

识别易受对抗攻击的神经网络层

机器学习 2021-11-01 v2 人工智能 计算机视觉与模式识别

摘要

本文中,我们研究使用对抗网络进行预训练,以探索网络深度与鲁棒性之间的关系。为此,我们使用非对抗和对抗数据在 CIFAR-10、Imagenette 和 ImageNet 上选择性地重新训练 VGG 和 ResNet 架构的不同部分。实验结果表明,对对抗样本的易感性关联于低级特征提取层。因此,仅重新训练高级层不足以实现鲁棒性。此外,对抗攻击使得早期层产生的输出在统计上不同于非对抗样本的特征,且不允许后续层进行一致分类。这支持了关于鲁棒性与特征提取器相关、深层在提供鲁棒性上不充分、以及对抗与非对抗特征向量间存在巨大差异的普遍假设。

关键词

引用

@article{arxiv.2107.04827,
  title  = {Identifying Layers Susceptible to Adversarial Attacks},
  author = {Shoaib Ahmed Siddiqui and Thomas Breuel},
  journal= {arXiv preprint arXiv:2107.04827},
  year   = {2021}
}