中文

扰动恢复:用于有效移除 CLIP 后门的微调方法

机器学习 2026-04-08 v3 密码学与安全 计算机视觉与模式识别

摘要

视觉语言模型如CLIP已被证明在将视觉感知与自然语言理解相链接方面效果极佳,使其能够实现强大的检索和零样本分类性能。广泛的使用,以及CLIP模型是从网上获取的图像文本对进行训练的事实,使其既是值得关注又相对容易针对后门攻击的目标。由于从头训练此类基础模型(如CLIP)代价极高,本文聚焦于通过微调清洁可能被投毒的模型。首先,我们表明现有清洁技术对Blended或BadNet等简单结构触发器不有效,这暴露了潜在实际部署这些模型的关键漏洞。随后,我们引入PAR(Perturb and Recover),一种意想不到却高效的机制,用于从CLIP模型中移除后门。通过针对不同编码器和不同类型后门攻击进行大量实验,我们表明PAR在保持良好标准性能的同时实现了高后门移除率。最后,我们说明即使仅使用合成文本图像对(即无需访问真实训练数据)我们的方案也同样有效。代码和模型均已在GitHub上提供。

关键词

引用

@article{arxiv.2412.00727,
  title  = {Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP},
  author = {Naman Deep Singh and Francesco Croce and Matthias Hein},
  journal= {arXiv preprint arXiv:2412.00727},
  year   = {2026}
}

备注

CVPR 2026 Findings