中文

利用对抗样本指纹逆向工程对抗攻击

人工智能 2023-02-02 v2

摘要

尽管研究投入巨大,深度神经网络仍然易受对抗样本的攻击:即一种迫使网络自信地产生错误输出的输入。对抗样本通常由攻击算法生成,该算法优化添加到良性输入上的扰动。目前已开发出许多此类算法。如果能够从对抗样本中逆向工程出攻击算法,则由于可溯源的可能性,这将对恶意行为者起到威慑作用。在此,我们将逆向工程表述为一个监督学习问题,其目标是将对抗样本分配到代表所用算法和参数的类别中。据我们所知,此前尚未证明这是否可行。我们首先测试是否可以对无防御单标签图像分类模型上攻击所添加到图像中的扰动进行分类。采取“以火攻火”的策略,我们利用深度神经网络对对抗样本的敏感性,训练它们对这些扰动进行分类。在一个 17 类数据集(5 种攻击,其中 4 种有界攻击各取 4 个 epsilon 值)上,我们使用在扰动上训练的 ResNet50 模型达到了 99.4% 的准确率。接着我们探究是否能在无法获取扰动的情况下完成该任务,通过信号处理算法估计扰动,我们将此方法称为“指纹识别”。我们发现 JPEG 算法作为一种简单而有效的指纹提取器(准确率 85.05%),为未来工作提供了强基线。我们讨论了如何将我们的方法扩展到攻击不可知的可学习指纹,以及包含未知攻击的开放世界场景。

关键词

引用

@article{arxiv.2301.13869,
  title  = {Reverse engineering adversarial attacks with fingerprints from adversarial examples},
  author = {David Aaron Nicholson and Vincent Emanuele},
  journal= {arXiv preprint arXiv:2301.13869},
  year   = {2023}
}

备注

8 pages, 6 figures