中文

基于隐式触发器的视觉语言模型后门攻击:巧妙语义操控

计算机视觉与模式识别 2025-06-10 v1 密码学与安全

摘要

视觉语言模型(VLMs)展现出卓越的性能,但也面临后门攻击的脆弱性,攻击者可通过隐藏触发器操控模型输出。先前的攻击主要依赖单一模态触发器,未充分探索VLMs中跨模态融合的关键特性。不同于先前工作,本文识别了一种新颖的攻击面,即利用跨模态语义不匹配作为隐式触发器。基于这一洞察,我们提出BadSem(Backdoor Attack with Semantic Manipulation),一种数据投毒攻击,通过刻意扰乱图像-文本配对来植入隐形后门。为实现此攻击,我们构建了SIMBad数据集,用于语义操控,涉及颜色和物体属性。广泛实验表明,BadSem在四个广泛使用的VLMs上实现了98%以上的平均攻击成功率,能良好推广至离群分布数据集,并可跨投毒模态传递。我们通过注意力可视化进行的详细分析显示,后门化模型在不匹配条件下聚焦于语义敏感区域,而在干净输入上保持正常行为。为缓解此攻击,我们尝试两种防御策略基于系统提示和监督微调,但发现两者均未能有效缓解语义后门。我们的发现凸显了迫切需要解决VLMs中语义漏洞的紧迫性,以确保其在实际部署中的安全性。

关键词

引用

@article{arxiv.2506.07214,
  title  = {Backdoor Attack on Vision Language Models with Stealthy Semantic Manipulation},
  author = {Zhiyuan Zhong and Zhen Sun and Yepang Liu and Xinlei He and Guanhong Tao},
  journal= {arXiv preprint arXiv:2506.07214},
  year   = {2025}
}