中文

主动对抗防御:利用面向视觉语言模型的提示调谐检测未发现的后门图像

计算机视觉与模式识别 2025-04-09 v4 人工智能 密码学与安全 机器学习

摘要

后门攻击通过嵌入隐藏触发器到输入中,以将其误分类到目标标签方面构成严重威胁。虽然大量研究聚焦于通过权重微调来缓解这些攻击在目标识别模型中的实施,但针对直接检测后门样本的注意力相对较少。鉴于训练中使用的海量数据集,手动检查后门触发器是不可行的,即使是最先进的防御机制也无法完全中和其影响。为填补这一差距,我们引入了一种 groundbreaking 方法,用于在训练和推理期间检测未发现的后门图像。利用在视觉语言模型(Vision Language Models,VLMs)中成功应用的提示调谐,我们的方法训练可学习的文本提示,以区分干净图像和带有隐藏后门触发器的图像。实验表明,这种方法在检测未发现的后门触发器方面效果卓越,平均准确率达到86%,并在两个著名数据集上建立了后门防御的新标准。

关键词

引用

@article{arxiv.2412.08755,
  title  = {Proactive Adversarial Defense: Harnessing Prompt Tuning in Vision-Language Models to Detect Unseen Backdoored Images},
  author = {Kyle Stein and Andrew Arash Mahyari and Guillermo Francia and Eman El-Sheikh},
  journal= {arXiv preprint arXiv:2412.08755},
  year   = {2025}
}