利用任意风格迁移提升对抗样本的迁移性
计算机视觉与模式识别
2023-08-22 v1 密码学与安全
机器学习
图像与视频处理
摘要
深度神经网络易受在干净输入上施加人类难以察觉的扰动所构造的对抗样本的攻击。尽管许多攻击方法在白盒设定下能取得很高的成功率,但在黑盒设定下却表现出较弱的迁移性。近来,人们提出了多种方法来提升对抗迁移性,其中输入变换是最有效的方法之一。在本工作中,我们注意到现有的基于输入变换的工作主要采用同域的变换数据进行增强。受域泛化启发,我们旨在利用来自不同域的增强数据进一步提升迁移性。具体而言,风格迁移网络能够改变图像中低级视觉特征的分布,同时为人类保留语义内容。因此,我们提出了一种名为风格迁移方法(Style Transfer Method, STM)的新型攻击方法,该方法利用所提出的任意风格迁移网络将图像变换到不同域。为避免风格化图像对分类网络产生不一致的语义信息,我们对风格迁移网络进行微调,并将加入随机噪声的生成图像与原始图像混合,以保持语义一致性并增强输入多样性。在 ImageNet 兼容数据集上的大量实验结果表明,相较于最先进的基于输入变换的攻击,我们所提方法在常规训练模型和对抗训练模型上均能显著提升对抗迁移性。代码见:https://github.com/Zhijin-Ge/STM。
引用
@article{arxiv.2308.10601,
title = {Improving the Transferability of Adversarial Examples with Arbitrary Style Transfer},
author = {Zhijin Ge and Fanhua Shang and Hongying Liu and Yuanyuan Liu and Liang Wan and Wei Feng and Xiaosen Wang},
journal= {arXiv preprint arXiv:2308.10601},
year = {2023}
}
备注
10 pages, 2 figures, accepted by the 31st ACM International Conference on Multimedia (MM '23)