利用极少测试样本将任意对抗攻击通用化
机器学习
2022-10-31 v2 计算机视觉与模式识别
机器学习
摘要
深度学习模型不仅已知易受输入相关对抗攻击,也易受输入无关或通用对抗攻击。Dezfooli 等人 \cite{Dezfooli17,Dezfooli17anal} 通过考察大量训练数据点及其附近决策边界的几何结构,在给定模型上构造通用对抗攻击。后续工作 \cite{Khrulkov18} 仅通过考察测试样本与给定模型的中间层构造通用攻击。本文提出一种简单的通用化技术,取任意输入相关对抗攻击,并仅通过考察极少对抗测试样本构造通用攻击。我们不需要给定模型的细节,且通用化计算开销可忽略。我们通过许多输入相关对抗扰动(如梯度、快速梯度符号法(FGSM)与 DeepFool)共有的谱性质从理论上论证了我们的通用化技术。利用矩阵集中不等式与谱扰动界,我们表明小测试样本上输入相关对抗方向的首奇异向量给出了一种有效且简单的通用对抗攻击。对于在 ImageNet 上训练的 VGG16 与 VGG19 模型,我们使用 64 张图像的测试样本对梯度、FGSM 与 DeepFool 扰动进行的简单通用化,在合理扰动范数下给出了与最先进通用攻击 \cite{Dezfooli17,Khrulkov18} 相当的欺骗率。代码见 https://github.com/ksandeshk/svd-uap 。
引用
@article{arxiv.2005.08632,
title = {Universalization of any adversarial attack using very few test examples},
author = {Sandesh Kamath and Amit Deshpande and K V Subrahmanyam and Vineeth N Balasubramanian},
journal= {arXiv preprint arXiv:2005.08632},
year = {2022}
}
备注
Appeared in ACM CODS-COMAD 2022 (Research Track)