中文

CBV:基于扩散模型的干净标签视觉语言模型后门攻击

人工智能 2026-05-05 v1

摘要

视觉语言模型(VLM)在图像字幕和视觉问答(VQA)等任务中取得了显著的成功。然而,随着其应用范围的不断扩大,近期研究发现 VLM 对后门攻击极其脆弱。现有 VLM 后门攻击主要依赖通过添加视觉触发器和修改文本标签进行数据投毒,导致诱导的图像-文本不匹配使受毒化样本容易被检测。为克服这一局限,我们提出通过扩散模型实现的干净标签后门攻击 VLM(CBV),该方法利用得分匹配生成自然的受毒化样本。具体而言,CBV 修改扩散模型逆生成过程中的得分,以引导生成包含触发器图像特征的受毒化样本。为进一步增强攻击效果,我们在生成过程中将触发图像的文本信息作为多模态引导。此外,为增强隐蔽性,我们引入了基于 GradCAM 的掩码(GM),限制修改仅限于最语义重要的区域,而非整个图像。我们在 MSCOCO 和 VQA v2 上对四个代表性 VLM 进行评估,实现超过 80% 的攻击成功率,同时保持正常功能。

关键词

引用

@article{arxiv.2605.02202,
  title  = {CBV: Clean-label Backdoor Attacks on Vision Language Models via Diffusion Models},
  author = {Ji Guo and Xiaolong Qin and Cencen Liu and Jielei Wang and Jierun Chen and Wenbo Jiang},
  journal= {arXiv preprint arXiv:2605.02202},
  year   = {2026}
}