通过排斥视觉提示调优来防御多模态后门模型
计算机视觉与模式识别
2025-10-31 v4
摘要
多模态对比学习模型(如 CLIP)可以从大规模图像-文本数据集中学习高质量的表征,但它们对后门攻击存在显著漏洞,引发严重的安全顾虑。本文揭示了 CLIP 的漏洞主要源于其倾向于编码超出数据集内预测模式的特征,损害了其视觉特征对输入扰动的抵抗力。这使得其编码特征高度易受后门触发器的重塑。为应对这一挑战,我们提出了排斥视觉提示调优(Repulsive Visual Prompt Tuning, RVPT),这是一种新型防御方法,采用精心设计的特征排斥损失的深度视觉提示调优。具体而言,RVPT 在优化标准交叉熵损失的同时,对编码更深层次的特征进行不利斥力,确保仅编码下游任务中的预测特征,从而增强 CLIP 视觉特征对输入扰动的抵抗力,并缓解其对后门攻击的易受性。与通常需要受污染数据或涉及整个模型微调的现有多模态后门防御方法不同,RVPT 利用少量干净的下游样本,仅调优少量参数。实验结果表明,RVPT 仅调优 CLIP 的 0.27% 参数,却显著优于领先的防御方法,在 ImageNet 上针对最先进的多模态攻击将攻击成功率从 89.70% 降至 2.76%,并有效地将其防御能力推广到多个数据集。
引用
@article{arxiv.2412.20392,
title = {Defending Multimodal Backdoored Models by Repulsive Visual Prompt Tuning},
author = {Zhifang Zhang and Shuo He and Haobo Wang and Bingquan Shen and Lei Feng},
journal= {arXiv preprint arXiv:2412.20392},
year = {2025}
}