在频域中检测AutoAttack扰动
计算机视觉与模式识别
2024-02-21 v3 密码学与安全
摘要
近来,AutoAttack(Croce and Hein, 2020b)框架对图像分类网络的对抗攻击引起了广泛关注。尽管AutoAttack展现出极高的攻击成功率,大多数防御方法聚焦于网络加固与鲁棒性增强,如对抗训练。以此方式,当前最佳报告方法在CIFAR10上可抵御约66%的对抗样本。本文中,我们研究AutoAttack的空间与频域特性并提出一种替代防御。我们不加固网络,而是在推理时检测对抗攻击,拒绝被操纵的输入。基于频域中相当简单且快速的分析,我们引入两种不同的检测算法。第一,仅对输入图像操作的黑盒检测器,在AutoAttack CIFAR10基准上达到100%检测准确率,在ImageNet上达到99.3%(两种情况下epsilon = 8/255)。第二,使用CNN特征图分析的白盒检测器,在相同基准上检测率同样为100%和98.7%。
引用
@article{arxiv.2111.08785,
title = {Detecting AutoAttack Perturbations in the Frequency Domain},
author = {Peter Lorenz and Paula Harder and Dominik Strassel and Margret Keuper and Janis Keuper},
journal= {arXiv preprint arXiv:2111.08785},
year = {2024}
}
备注
accepted at ICML 2021 workshop for robustness