一神经元以惑之:针对单个敏感神经元的对抗攻击
机器学习
2020-06-11 v2 机器学习
摘要
尽管对抗样本研究广泛,模型易损性的根本原因仍未被充分理解。我们未着眼于攻击特定的鲁棒性,而是提出一种评估单个神经元敏感性的概念,即模型输出对该神经元输出的直接扰动的鲁棒程度。从该视角分析模型揭示了标准模型与对抗训练鲁棒模型的显著特征,并带来若干有趣结果。在 CIFAR-10 与 ImageNet 的实验中,我们发现使用仅针对单个敏感神经元的损失函数的攻击,几乎与针对完整模型的攻击一样有效地找到对抗样本。我们分析这些敏感神经元的属性,提出一种正则化项,可帮助模型在对自然数据分布保持准确率的同时,实现对多种不同扰动约束的鲁棒性。我们所有实验的代码可在 https://github.com/iamgroot42/sauron 获取。
引用
@article{arxiv.2003.09372,
title = {One Neuron to Fool Them All},
author = {Anshuman Suri and David Evans},
journal= {arXiv preprint arXiv:2003.09372},
year = {2020}
}
备注
Updated 'PGD' columns of Table 1: numbers reported earlier for this column were (100 - accuracy) instead of attack success rates. Observations and conclusions remain unchanged