CleanCLIP:缓解多模态对比学习中的数据投毒攻击
计算机视觉与模式识别
2023-07-18 v3 人工智能
密码学与安全
机器学习
摘要
多模态对比预训练已被用于在大量配对图像-文本数据上训练如 CLIP 等多模态表示模型。然而,先前的研究表明此类模型易受后门攻击。具体而言,当在植入后门的数据上训练时,CLIP 会学习嵌入的后门触发词与目标标签之间的虚假关联,在联合嵌入空间中对齐其表示。即便仅注入少量投毒样本(如 300 万预训练数据中的 75 个样本),也能显著操纵模型行为,使其难以检测或遗忘此类关联。为解决该问题,我们提出 CleanCLIP,一种通过独立地重新对齐各模态表示来削弱后门攻击引入的已学习虚假关联的微调框架。我们证明,结合多模态对比与各模态单模态自监督目标的无监督微调可显著降低后门攻击的影响。此外,我们表明在任务特定的标注图像数据上进行有监督微调可去除 CLIP 视觉编码器中的后门触发词。我们通过实验证明,CleanCLIP 在良性样本上保持模型性能的同时,消除了多模态对比学习中的一系列后门攻击。代码与检查点可在 https://github.com/nishadsinghi/CleanCLIP 获取。
引用
@article{arxiv.2303.03323,
title = {CleanCLIP: Mitigating Data Poisoning Attacks in Multimodal Contrastive Learning},
author = {Hritik Bansal and Nishad Singhi and Yu Yang and Fan Yin and Aditya Grover and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2303.03323},
year = {2023}
}
备注
22 pages. Accepted at ICCV 2023