与下游任务无关的对抗样本
计算机视觉与模式识别
2023-08-15 v2
摘要
自监督学习通常利用大量无标签数据预训练一个编码器,该编码器可作为通用特征提取器,使得下游用户只需进行微调操作即可享受“大模型”的益处。尽管前景广阔,预训练编码器的安全性尚未被彻底研究,尤其是当预训练编码器公开供商业使用时。本文提出 AdvEncoder,首个基于预训练编码器生成与下游任务无关的通用对抗样本的框架。AdvEncoder 旨在为一组自然图像构造通用对抗扰动或对抗补丁,以欺骗所有继承受害预训练编码器的下游任务。与传统对抗样本工作不同,预训练编码器仅输出特征向量而非分类标签。因此,我们首先利用图像的高频分量信息来引导对抗样本的生成。随后我们设计了一个生成式攻击框架,通过学习攻击代理数据集的分布来构造对抗扰动/补丁,以提升其攻击成功率和可迁移性。我们的结果表明,攻击者在既不知道预训练数据集也不知道下游数据集的情况下,也能成功攻击下游任务。我们还为预训练编码器量身定制了四种防御方法,其结果进一步证明了 AdvEncoder 的攻击能力。
引用
@article{arxiv.2307.12280,
title = {Downstream-agnostic Adversarial Examples},
author = {Ziqi Zhou and Shengshan Hu and Ruizhi Zhao and Qian Wang and Leo Yu Zhang and Junhui Hou and Hai Jin},
journal= {arXiv preprint arXiv:2307.12280},
year = {2023}
}
备注
This paper has been accepted by the International Conference on Computer Vision (ICCV '23, October 2--6, 2023, Paris, France)