GNP攻击:基于梯度范数惩罚的可迁移对抗样本
机器学习
2023-07-11 v1 密码学与安全
计算机视觉与模式识别
摘要
具有良好可迁移性的对抗样本(AE)能够对多种目标模型实现实用的黑箱攻击,且无需关于目标模型的内部知识。先前的方法生成的AE往往无可迁移性或可迁移性非常有限;即它们容易过拟合于源白箱模型的特定架构与特征表示,所生成的AE几乎无法作用于目标黑箱模型。本文中,我们提出一种利用梯度范数惩罚(GNP)来增强AE可迁移性的新方法。它驱动损失函数优化过程收敛至损失景观中局部最优的平坦区域。通过对11个最先进(SOTA)深度学习模型与6种先进防御方法进行攻击,我们实证表明GNP在生成高可迁移性AE方面非常有效。我们还证明其具有高度灵活性,可轻松与其他基于梯度的方法集成以实现更强的基于迁移的攻击。
引用
@article{arxiv.2307.04099,
title = {GNP Attack: Transferable Adversarial Examples via Gradient Norm Penalty},
author = {Tao Wu and Tie Luo and Donald C. Wunsch},
journal= {arXiv preprint arXiv:2307.04099},
year = {2023}
}
备注
30th IEEE International Conference on Image Processing (ICIP), October 2023