中文

在频域中检测AutoAttack扰动

计算机视觉与模式识别 2024-02-21 v3 密码学与安全

摘要

近来,AutoAttack(Croce and Hein, 2020b)框架对图像分类网络的对抗攻击引起了广泛关注。尽管AutoAttack展现出极高的攻击成功率,大多数防御方法聚焦于网络加固与鲁棒性增强,如对抗训练。以此方式,当前最佳报告方法在CIFAR10上可抵御约66%的对抗样本。本文中,我们研究AutoAttack的空间与频域特性并提出一种替代防御。我们不加固网络,而是在推理时检测对抗攻击,拒绝被操纵的输入。基于频域中相当简单且快速的分析,我们引入两种不同的检测算法。第一,仅对输入图像操作的黑盒检测器,在AutoAttack CIFAR10基准上达到100%检测准确率,在ImageNet上达到99.3%(两种情况下epsilon = 8/255)。第二,使用CNN特征图分析的白盒检测器,在相同基准上检测率同样为100%和98.7%。

关键词

引用

@article{arxiv.2111.08785,
  title  = {Detecting AutoAttack Perturbations in the Frequency Domain},
  author = {Peter Lorenz and Paula Harder and Dominik Strassel and Margret Keuper and Janis Keuper},
  journal= {arXiv preprint arXiv:2111.08785},
  year   = {2024}
}

备注

accepted at ICML 2021 workshop for robustness