预训练对抗扰动
计算机视觉与模式识别
2022-10-17 v2 人工智能
摘要
自监督预训练近年来受到越来越多的关注,因其在微调后众多下游任务上的优越性能。然而,众所周知,深度学习模型缺乏对对抗样本的鲁棒性,这也可能引发预训练模型的安全问题,尽管这一点较少被探索。在本文中,我们通过引入预训练对抗扰动(PAPs)来深入研究预训练模型的鲁棒性,PAPs 是为预训练模型设计的通用扰动,可在不知晓下游任务的情况下攻击微调后的模型时保持有效性。为此,我们提出了一种低层提升攻击(L4A)方法,通过提升预训练模型低层神经元的激活来生成有效的 PAPs。结合增强的噪声增强策略,L4A 能有效地生成对微调模型更具迁移性的 PAPs。在典型预训练视觉模型和十个下游任务上的大量实验表明,与最先进的方法相比,我们的方法大幅提高了攻击成功率。
引用
@article{arxiv.2210.03372,
title = {Pre-trained Adversarial Perturbations},
author = {Yuanhao Ban and Yinpeng Dong},
journal= {arXiv preprint arXiv:2210.03372},
year = {2022}
}