中文

通过反攻击检测迭代对抗攻击

机器学习 2021-03-24 v2 密码学与安全 计算机视觉与模式识别 机器学习

摘要

深度神经网络(DNNs)已被证明是处理非结构化数据的强大工具。然而对于图像等高维数据,它们天生易受对抗攻击。添加到输入上的微小且几乎不可见的扰动可用于欺骗 DNNs。近年来已提出各种攻击、加固方法和检测方法。众所周知,通过迭代最小化计算的 Carlini-Wagner(CW)型攻击属于最难检测的攻击之一。在这项工作中,我们概述了一个数学证明,即 CW 攻击本身可用作检测器。也就是说,在特定假设下并在攻击迭代的极限中,该检测器对原始图像和受攻击图像提供了渐近最优的分离。在数值实验中,我们实验验证了这一结论,并进一步在 CIFAR10 和 ImageNet 上获得了高达 99.73% 的 AUROC 值。这处于当前 CW 攻击检测率最优水平区间的上部。

关键词

引用

@article{arxiv.2009.11397,
  title  = {Detection of Iterative Adversarial Attacks via Counter Attack},
  author = {Matthias Rottmann and Kira Maag and Mathis Peyron and Natasa Krejic and Hanno Gottschalk},
  journal= {arXiv preprint arXiv:2009.11397},
  year   = {2021}
}