中文

视觉提示学习中的提示后门攻击

密码学与安全 2023-10-12 v1 计算机视觉与模式识别 机器学习

摘要

对资源受限的用户而言,微调大型预训练计算机视觉模型是不可行的。因此,视觉提示学习(VPL)通过视觉提示即服务(VPPTaaS)提供了一种高效且灵活的模型微调替代方案。具体而言,VPPTaaS提供方根据下游数据优化视觉提示,下游用户可将该提示与大型预训练模型结合用于预测。然而,当VPPTaaS提供方转而提供恶意视觉提示时,这种新学习范式也可能带来安全风险。本文首次从后门攻击的视角探究此类风险。具体地,我们提出BadVisualPrompt,一种针对VPL简单而有效的后门攻击。例如,毒化5%5\%的CIFAR10训练数据可导致 above 99%99\%的攻击成功率,且模型准确率仅可忽略地下降1.5%1.5\%。特别地,我们识别并解决了一个与后门触发器和视觉提示之间交互相关的新技术挑战,该挑战在传统的模型级后门中不存在。此外,我们从模型、提示和输入层面对七种后门防御进行了深入分析。总体而言,这些防御要么无效,要么不实用,无法缓解我们的BadVisualPrompt,意味着VPL存在严重漏洞。

关键词

引用

@article{arxiv.2310.07632,
  title  = {Prompt Backdoors in Visual Prompt Learning},
  author = {Hai Huang and Zhengyu Zhao and Michael Backes and Yun Shen and Yang Zhang},
  journal= {arXiv preprint arXiv:2310.07632},
  year   = {2023}
}