中文

GNP攻击:基于梯度范数惩罚的可迁移对抗样本

机器学习 2023-07-11 v1 密码学与安全 计算机视觉与模式识别

摘要

具有良好可迁移性的对抗样本(AE)能够对多种目标模型实现实用的黑箱攻击,且无需关于目标模型的内部知识。先前的方法生成的AE往往无可迁移性或可迁移性非常有限;即它们容易过拟合于源白箱模型的特定架构与特征表示,所生成的AE几乎无法作用于目标黑箱模型。本文中,我们提出一种利用梯度范数惩罚(GNP)来增强AE可迁移性的新方法。它驱动损失函数优化过程收敛至损失景观中局部最优的平坦区域。通过对11个最先进(SOTA)深度学习模型与6种先进防御方法进行攻击,我们实证表明GNP在生成高可迁移性AE方面非常有效。我们还证明其具有高度灵活性,可轻松与其他基于梯度的方法集成以实现更强的基于迁移的攻击。

关键词

引用

@article{arxiv.2307.04099,
  title  = {GNP Attack: Transferable Adversarial Examples via Gradient Norm Penalty},
  author = {Tao Wu and Tie Luo and Donald C. Wunsch},
  journal= {arXiv preprint arXiv:2307.04099},
  year   = {2023}
}

备注

30th IEEE International Conference on Image Processing (ICIP), October 2023