神经解毒剂:用于净化 CLIP 中后门的类别相关提示调优
计算机视觉与模式识别
2025-09-23 v2
摘要
虽然基于深度学习的视觉-语言模型(如 CLIP)在多模态数据表示方面展现出惊人的能力,但近期研究揭示了其对后门攻击的脆弱性。为缓解这一威胁,现有防御策略主要集中于对整个可疑模型进行微调。然而,大规模模型参数会增加获得稳定一致优化方向的难度,限制了其对最新攻击手段的抵抗力,并常常导致干净数据准确率下降。为解决这一挑战,我们提出了类别相关后门提示调优(Class-wise Backdoor Prompt Tuning, CBPT),这是一种高效且有效的防御机制, operates on text prompts(文本提示)以间接方式净化被投毒的 CLIP。具体而言,我们首先采用精心设计的正负样本进行对比学习,以有效逆转攻击者可能使用的后门触发器。一旦构建出虚拟触发器,我们便利用三个精心设计的损失函数来优化这些类别相关文本提示,从而修改模型的决策边界,并进一步重新分类受后门触发器影响的特征区域。大量实验表明,CBPT 在缓解后门威胁的同时,能够保持模型实用性,例如在七种主流后门攻击下的平均干净准确率(Clean Accuracy, CA)为 58.83%,攻击成功率(Attack Success Rate, ASR)为 0.39%。这些结果凸显了我们在提示净化设计方面的优越性,以增强 CLIP 对后门攻击的鲁棒性。
引用
@article{arxiv.2502.19269,
title = {Neural Antidote: Class-Wise Prompt Tuning for Purifying Backdoors in CLIP},
author = {Jiawei Kong and Hao Fang and Sihang Guo and Chenxi Qing and Kuofeng Gao and Bin Chen and Shu-Tao Xia and Ke Xu},
journal= {arXiv preprint arXiv:2502.19269},
year = {2025}
}