中文

BadEncoder:针对自监督学习中预训练编码器的后门攻击

密码学与安全 2021-08-03 v1 计算机视觉与模式识别 机器学习

摘要

计算机视觉中的自监督学习旨在利用大量无标签图像或(图像,文本)对来预训练一个图像编码器。该预训练图像编码器随后可作为特征提取器,以少量或无标签训练数据构建许多下游任务的下游分类器。在本工作中,我们提出 BadEncoder,这是首个针对自监督学习的后门攻击。具体而言,我们的 BadEncoder 将后门注入预训练图像编码器,使得基于该被植入后门的图像编码器为不同下游任务构建的下游分类器同时继承后门行为。我们将 BadEncoder 表述为一个优化问题,并提出一种基于梯度下降的方法来求解它,该方法从干净编码器生成被植入后门的图像编码器。我们在多个数据集上的大量实证评估结果表明,我们的 BadEncoder 在保持下游分类器准确率的同时实现了高攻击成功率。我们还使用两个公开可用的真实世界图像编码器,即 Google 在 ImageNet 上预训练的图像编码器和 OpenAI 的对比语言-图像预训练(CLIP)图像编码器(在互联网收集的 4 亿(图像,文本)对上预训练),展示了 BadEncoder 的有效性。此外,我们考虑了包括 Neural Cleanse 和 MNTD(经验性防御)以及 PatchGuard(可证明防御)在内的防御方法。我们的结果表明,这些防御不足以抵御 BadEncoder,凸显了针对我们的 BadEncoder 开发新防御的必要性。我们的代码公开于:https://github.com/jjy1994/BadEncoder。

关键词

引用

@article{arxiv.2108.00352,
  title  = {BadEncoder: Backdoor Attacks to Pre-trained Encoders in Self-Supervised Learning},
  author = {Jinyuan Jia and Yupei Liu and Neil Zhenqiang Gong},
  journal= {arXiv preprint arXiv:2108.00352},
  year   = {2021}
}

备注

To appear in IEEE Symposium on Security and Privacy, 2022