中文

CLIP 的对抗性后门防御

计算机视觉与模式识别 2024-09-25 v1

摘要

多模态对比预训练以 CLIP 等模型为代表,已被发现易受到后门攻击。虽然当前的后门防御方法主要采用常规数据增强以创建增强样本以实现特征对齐,但这些方法未能捕捉后门样本的独特特征,导致防御效果不佳。观察发现,对抗样本与后门样本在被攻击模型的特征空间中 exhibits 相似性。基于此洞察,我们提出了一种名为对抗性后门防御 (Adversarial Backdoor Defense, ABD) 的新型数据增强策略,通过与精心构建的对抗样本对齐特征,从而有效干扰后门关联。我们的实验表明,ABD 对针对 CLIP 的传统单模态和多模态后门攻击均提供了稳健的防御。相较于当前最先进的防御方法 CleanCLIP,ABD 对 BadNet 的攻击成功率降低 8.66%,对 Blended 的攻击成功率降低 10.52%,对 BadCLIP 的攻击成功率降低 53.64%,而保持仅 1.73% 的干净准确率下降。

关键词

引用

@article{arxiv.2409.15968,
  title  = {Adversarial Backdoor Defense in CLIP},
  author = {Junhao Kuang and Siyuan Liang and Jiawei Liang and Kuanrong Liu and Xiaochun Cao},
  journal= {arXiv preprint arXiv:2409.15968},
  year   = {2024}
}