中文

宁可稳妥勿后悔:面向针对性数据投毒与后门攻击的 CLIP 预训练防护

机器学习 2024-06-12 v2 人工智能 密码学与安全 计算机视觉与模式识别

摘要

在大型图像-文本对数据集上进行对比语言-图像预训练(CLIP)已在零样本分类中取得显著成功,并实现了向新领域的可迁移性。然而,与监督学习相比,CLIP 对针对性数据投毒与后门攻击极为脆弱。或许令人惊讶的是,仅需投毒 0.0001% 的 CLIP 预训练数据就足以使针对性数据投毒攻击成功。这比投毒监督模型所需量少四个数量级。尽管存在此漏洞,现有方法在预训练期间防御 CLIP 模型方面非常有限。本工作中,我们提出一种强防御方法 SAFECLIP,以在预训练时安全防御 CLIP 免受针对性数据投毒与后门攻击。SAFECLIP 通过在图像与文本模态上分别应用单模态对比学习(CL)对模型进行预热。随后,它通过对图像-文本对表示的余弦相似度应用高斯混合模型,将数据划分为安全集与风险集。SAFECLIP 通过对安全集应用 CLIP 损失、对风险集的图像与文本模态分别应用单模态 CL 来预训练模型。通过在预训练期间逐步扩大安全集规模,SAFECLIP 有效阻断针对性数据投毒与后门攻击,且不损害 CLIP 性能。我们在 CC3M、Visual Genome 与 MSCOCO 上的大量实验表明,SAFECLIP 将针对性数据投毒攻击成功率从 93.75% 显著降低至 0%,并将各类后门攻击成功率从最高 100% 降至 0%,且不损害 CLIP 性能。

关键词

引用

@article{arxiv.2310.05862,
  title  = {Better Safe than Sorry: Pre-training CLIP against Targeted Data Poisoning and Backdoor Attacks},
  author = {Wenhan Yang and Jingdong Gao and Baharan Mirzasoleiman},
  journal= {arXiv preprint arXiv:2310.05862},
  year   = {2024}
}