中文

BadCLIP++: 多模态对比学习中的隐形且持久的后门攻击

计算机视觉与模式识别 2026-02-20 v1

摘要

针对多模态对比学习模型的后门攻击研究面临两个关键挑战:隐形性和持久性。现有方法在强检测或持续微调下往往失败,主要由于 (1) 跨模态不一致导致触发模式暴露,以及 (2) 在低投毒率下梯度稀释加速后门遗忘。这两种耦合原因仍未得到充分建模和解决。我们提出 BadCLIP++,一个统一框架以解决这两个挑战。为实现隐形性,我们引入语义融合 QR 微触发器,在与任务相关区域嵌入不可察觉的模式,保持干净数据统计的同时产生紧凑的触发分布。我们进一步应用目标对齐子集选择以强化低注入率下的信号。为实现持久性,我们通过半径收缩和质心对齐稳定触发嵌入,通过曲率控制和弹性权重整合稳定模型参数,使解决方案保持在低曲率宽底谷中,抗微调。我们还提供首个理论分析表明,在信任区域内,干净微调和后门目标的梯度同向,从而产生攻击成功率下降的非增上界。实验显示,在仅 0.3% 投毒情况下,BadCLIP++ 在数字设置下实现 99.99% 的攻击成功率 (ASR),超越基线 11.4 分。在十九种防御措施下,ASR 保持在 99.90% 以上,干净准确率下降不到 0.8%。该方法还实现了 65.03% 的物理攻击成功率,并对水印去除防御具有鲁棒性。

关键词

引用

@article{arxiv.2602.17168,
  title  = {BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning},
  author = {Siyuan Liang and Yongcheng Jing and Yingjie Wang and Jiaxing Huang and Ee-chien Chang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2602.17168},
  year   = {2026}
}

备注

25 pages, 10 figures