面向数据投毒与后门攻击的鲁棒对比语言-图像预训练
计算机视觉与模式识别
2023-12-21 v2 计算与语言
密码学与安全
机器学习
摘要
对比视觉-语言表示学习通过从互联网爬取的百万级图像-描述对进行学习,已在零样本分类中取得最先进的性能。然而,支撑如 CLIP 等大型多模态模型的海量数据,使它们极易受到各类定向数据投毒和后门攻击。尽管存在此漏洞,针对此类攻击的鲁棒对比视觉-语言预训练仍未被解决。在本工作中,我们提出 ROCLIP,这是首个针对定向数据投毒和后门攻击鲁棒预训练多模态视觉-语言模型的有效方法。ROCLIP 通过考虑一个相对较大且变化的随机描述池,并每隔若干轮将每张图像与池中而非其自身描述中最相似文本匹配,有效打破了投毒图像-描述对之间的关联。它还利用图像和文本增强来进一步加强防御并提升模型性能。我们大量实验表明,ROCLIP 在 CLIP 模型预训练期间使最先进的定向数据投毒和后门攻击失效。特别地,ROCLIP 将定向数据投毒攻击成功率从 93.75% 降至 12.5%,并将后门攻击成功率降至 0%,同时将模型的线性探测性能提升 10%,并与 CLIP 相比保持相似的零样本性能。通过增加匹配频率,ROCLIP 能够防御向数据中添加多达 1% 投毒样本的强攻击,并成功将攻击成功率维持在较低的 12.5%,同时在一些任务上牺牲了性能。
引用
@article{arxiv.2303.06854,
title = {Robust Contrastive Language-Image Pre-training against Data Poisoning and Backdoor Attacks},
author = {Wenhan Yang and Jingdong Gao and Baharan Mirzasoleiman},
journal= {arXiv preprint arXiv:2303.06854},
year = {2023}
}