AttackBench:评估对抗样本的梯度基攻击
机器学习
2025-05-13 v3 密码学与安全
计算机视觉与模式识别
摘要
对抗样本通常使用基于梯度的攻击进行优化。尽管不断提出新型攻击,但每种攻击都使用不同的实验设置、超参数设置和目标模型的前向和后向调用次数来显示其优于前任。这种做法会导致过于乐观甚至偏差的评估,可能不公平地偏好某一特定攻击。在本工作中,我们通过提出 AttackBench 框架来克服这些限制,即第一个能够在不同攻击之间进行公平比较的评估框架。为此,我们首先提出了基于梯度的攻击的分类,确定其主要组件和差异。我们然后引入我们的框架,对其有效性和效率进行评估。我们通过 (i) 定义一种度量标准,用于量化攻击距离最优解的程度,以及 (ii) 限制对模型的前向和后向查询次数,使得所有攻击都在给定的最大查询预算内进行比较。我们的广泛实验分析将超过 个攻击实现,总计超过 种不同的配置,对抗 CIFAR-10 和 ImageNet 模型进行比较,揭示了只有极少数攻击在所有竞争方法中均表现出色。在此分析中,我们揭示了许多实施问题会阻止许多攻击找到更好的解决方案或根本无法运行。我们将 AttackBench 作为公开可用的基准发布,旨在持续更新以包括和评估用于优化对抗样本的新型基于梯度的攻击。
关键词
引用
@article{arxiv.2404.19460,
title = {AttackBench: Evaluating Gradient-based Attacks for Adversarial Examples},
author = {Antonio Emanuele Cinà and Jérôme Rony and Maura Pintor and Luca Demetrio and Ambra Demontis and Battista Biggio and Ismail Ben Ayed and Fabio Roli},
journal= {arXiv preprint arXiv:2404.19460},
year = {2025}
}
备注
Paper accepted at AAAI2025. Project page and leaderboard: https://attackbench.github.io