BadCLIP:面向多模态对比学习的双嵌入引导后门攻击
计算机视觉与模式识别
2024-03-05 v3
摘要
研究后门攻击对于模型版权保护及增强防御具有重要价值。尽管现有后门攻击已成功感染CLIP等多模态对比学习(MCL)模型,但它们易被针对MCL模型的专门后门防御所化解。本文揭示了这一实际场景中的威胁:后门攻击即使在防御之后仍可保持有效,并引入了\emph{\toolns}攻击,该攻击可抵抗后门检测与模型微调防御。为此,我们从贝叶斯准则视角获取动机,提出一种用于后门攻击的双嵌入引导框架。具体而言,我们确保视觉触发模式在嵌入空间中逼近文本目标语义,使得在此类自然触发模式上由后门学习引起的细微参数变化难以被检测。此外,我们优化视觉触发模式以使中毒样本与目标视觉特征对齐,从而阻碍通过干净微调进行的后门遗忘。大量实验表明,在存在最先进(SoTA)后门防御的情况下,我们的攻击显著优于最先进基线(+45.3% ASR),使这些缓解与检测策略基本失效。此外,我们的方法能有效攻击下游任务等更严苛的场景。我们相信本文可提高对多模态对比学习实际应用潜在威胁的认识,并鼓励开发更稳健的防御机制。
引用
@article{arxiv.2311.12075,
title = {BadCLIP: Dual-Embedding Guided Backdoor Attack on Multimodal Contrastive Learning},
author = {Siyuan Liang and Mingli Zhu and Aishan Liu and Baoyuan Wu and Xiaochun Cao and Ee-Chien Chang},
journal= {arXiv preprint arXiv:2311.12075},
year = {2024}
}
备注
The paper lacks some work that needs to be cited