利用生成模型生成可迁移的通用对抗扰动
计算机视觉与模式识别
2020-10-30 v2
摘要
深度神经网络往往易受对抗扰动的攻击,将扰动加到自然图像上可以以高置信度欺骗相应模型。最近,与图像无关的扰动(也称为通用对抗扰动,UAPs)被发现。然而,现有 UAPs 在应用于未知目标模型时仍缺乏足够高的欺骗率。在本文中,我们提出了一种新颖的深度学习技术来生成更具可迁移性的 UAPs。我们利用一个扰动生成器和一些给定的预训练网络(即源模型),使用 ImageNet 数据集来生成 UAPs。由于各种模型架构在第一层中具有相似的特征表示,我们提出了一种损失形式,仅关注源模型各自第一层中的对抗能量。这支持了我们生成的 UAPs 向任何其他目标模型的迁移性。我们进一步实证分析了我所生成的 UAPs,并证明这些扰动对不同目标模型具有很好的泛化能力。在欺骗率和模型迁移性两方面均超越了当前最先进水平(SOTA),我们可以证明所提方法的优越性。使用我们生成的非定向 UAPs,我们在源模型上获得了 93.36% 的平均欺骗率(最先进水平:82.16%)。在深度 ResNet-152 上生成我们的 UAPs,我们在 VGG-16 和 VGG-19 目标模型上相比前沿方法获得了约 12% 的绝对欺骗率优势。
引用
@article{arxiv.2010.14919,
title = {Transferable Universal Adversarial Perturbations Using Generative Models},
author = {Atiye Sadat Hashemi and Andreas Bär and Saeed Mozaffari and Tim Fingscheidt},
journal= {arXiv preprint arXiv:2010.14919},
year = {2020}
}