中文

对抗可迁移性的可靠评估

计算机视觉与模式识别 2023-06-16 v1

摘要

带有微小对抗扰动的对抗样本(AEs)可误导深度神经网络(DNNs)做出错误预测。在一个DNN上生成的AEs也能欺骗另一个DNN。过去几年中,AEs的可迁移性因作为促进黑盒攻击的关键性质而备受关注。许多方法被提出以提升对抗可迁移性。然而,它们主要在多种卷积神经网络(CNN)架构间验证,这并非可靠评估,因为所有CNN都共享某些相似的架构偏置。本工作中,我们重新评估了12种具代表性的可迁移性增强攻击方法,在来自4类神经网络的18个流行模型上测试。我们的重新评估揭示,对抗可迁移性常被高估,且不存在能迁移至所有流行模型的单一AE。先前攻击方法的可迁移性排名在我们的综合评估下发生改变。基于我们的分析,我们提出一个包含三种评估协议的可靠基准。在我们的新基准上,对抗可迁移性极低,进一步证实了可迁移性被高估。我们在 https://adv-trans-eval.github.io 发布基准以促进未来研究,其中包含代码、模型检查点与评估协议。

关键词

引用

@article{arxiv.2306.08565,
  title  = {Reliable Evaluation of Adversarial Transferability},
  author = {Wenqian Yu and Jindong Gu and Zhijiang Li and Philip Torr},
  journal= {arXiv preprint arXiv:2306.08565},
  year   = {2023}
}