基于对比提示的测试时多模态后门检测
计算机视觉与模式识别
2025-09-23 v3 机器学习
摘要
虽然多模态对比学习方法(如CLIP)可实现惊人的零样本分类性能,但近期研究表明,这些方法对后门攻击十分脆弱。为防御CLIPS的后门攻击,现有防御方法要么针对预训练阶段,要么针对微调阶段,这不利于大量参数更新,导致高计算成本,且不适用于黑盒设置。本文首次尝试一种计算效率高的后门检测方法,以防御推理阶段的受控CLIP。我们经验性地发现,后门图像的视觉表征对类描述文本中的恶意和良性变化不够敏感。基于此观察,我们提出了一种基于对比提示的新型测试时后门检测方法,即BDetCLIP。具体而言,我们首先提示语言模型(如GPT-4)通过特殊设计的指令生成与类相关的描述文本(良性)和类扰动随机文本(恶意)。随后,图像与这两种类描述文本之间余弦相似度分布差异可用于检测后门样本。广泛的实验表明,我们提出的BDetCLIP在有效性和效率方面均优于当前最先进的后门检测方法。我们的代码已公开:https://github.com/Purshow/BDetCLIP。
引用
@article{arxiv.2405.15269,
title = {Test-Time Multimodal Backdoor Detection by Contrastive Prompting},
author = {Yuwei Niu and Shuo He and Qi Wei and Zongyu Wu and Feng Liu and Lei Feng},
journal= {arXiv preprint arXiv:2405.15269},
year = {2025}
}
备注
Accepted to ICML2025