中文

通过双模态对抗提示越狱视觉语言模型

计算机视觉与模式识别 2024-07-02 v2 密码学与安全

摘要

在大型视觉语言模型(LVLMs)领域,越狱攻击作为一种红队测试方法,用于绕过安全护栏并揭示安全隐患。现有的越狱方法主要关注视觉模态,仅扰动提示中的视觉输入进行攻击。然而,当面对同时融合视觉和文本特征进行生成的对齐模型时,这些方法效果不佳。为解决这一局限,本文提出了双模态对抗提示攻击(BAP),通过协同优化文本和视觉提示来执行越狱。首先,我们在图像中对抗性地嵌入普遍有害的扰动,由少量样本的查询无关语料(如肯定前缀和否定抑制)引导。这一过程确保图像提示LVLMs对任何有害查询做出肯定响应。随后,利用对抗图像,我们针对特定有害意图优化文本提示。具体而言,我们利用大语言模型分析越狱失败案例,并通过思维链推理以反馈迭代方式优化文本提示。为验证方法的有效性,我们在多个数据集和LVLMs上进行了广泛评估,结果表明我们的方法在攻击成功率上平均大幅超越其他方法(+29.03%)。此外,我们还展示了攻击在黑盒商业LVLMs(如Gemini和ChatGLM)上的潜力。

关键词

引用

@article{arxiv.2406.04031,
  title  = {Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt},
  author = {Zonghao Ying and Aishan Liu and Tianyuan Zhang and Zhengmin Yu and Siyuan Liang and Xianglong Liu and Dacheng Tao},
  journal= {arXiv preprint arXiv:2406.04031},
  year   = {2024}
}