中文

通过扩散模型高效生成面向视觉-语言模型的定向可迁移对抗样本

计算机视觉与模式识别 2024-12-17 v4

摘要

对抗攻击,特别是定向基于迁移的攻击,可用于评估大型视觉-语言模型(VLMs)的对抗鲁棒性,从而在部署前更彻底地检查潜在的安全漏洞。然而,以往的基于迁移的对抗攻击由于迭代次数高和方法结构复杂而成本高昂。此外,由于对抗语义的不自然性,生成的对抗样本可迁移性低。这些问题限制了现有方法在评估鲁棒性方面的实用性。为了解决这些问题,我们提出了AdvDiffVLM,它利用扩散模型通过分数匹配生成自然、无限制且定向的对抗样本。具体地,AdvDiffVLM使用自适应集成梯度估计在扩散模型的反向生成过程中修改分数,确保生成的对抗样本具有自然的对抗定向语义,从而提高其可迁移性。同时,为了提高对抗样本的质量,我们使用GradCAM引导的掩码方法将对抗语义分散到整个图像中,而不是集中在单个区域。最后,AdvDiffVLM在多次迭代后将更多目标语义嵌入到对抗样本中。实验结果表明,我们的方法生成对抗样本的速度比最先进的基于迁移的对抗攻击快5到10倍,同时保持更高质量的对抗样本。此外,与以往的基于迁移的对抗攻击相比,我们的方法生成的对抗样本具有更好的可迁移性。值得注意的是,AdvDiffVLM可以在黑盒环境下成功攻击多种商业VLM,包括GPT-4V。

关键词

引用

@article{arxiv.2404.10335,
  title  = {Efficient Generation of Targeted and Transferable Adversarial Examples for Vision-Language Models Via Diffusion Models},
  author = {Qi Guo and Shanmin Pang and Xiaojun Jia and Yang Liu and Qing Guo},
  journal= {arXiv preprint arXiv:2404.10335},
  year   = {2024}
}