中文

通过多损失对抗搜索探索视觉漏洞:针对jailbreaking视觉语言模型

计算机视觉与模式识别 2024-12-02 v2

摘要

尽管继承了底层语言模型的安全措施,视觉语言模型 (VLM) 仍可能存在安全对齐问题的漏洞。通过实证分析,我们发现情境匹配的图像能显著放大有害输出,而与梯度攻击中常见假设相反,最小损失值并不保证攻击效果最佳。基于这些发现,我们引入了MLAI (Multi-Loss Adversarial Images),一种新的jailbreak框架,利用情境感知图像生成实现语义对齐,利用平坦最小理论实现鲁棒性对抗图像选择,并采用多图像协作攻击提高效果。大量实验表明,MLAI具有显著影响,在MiniGPT-4和LLaVA-2上的攻击成功率分别为77.75%和82.80%,显著优于现有方法,分别高出34.37%和12.77%。此外,MLAI在商业黑盒VLM中显示出相当好的可迁移性,最高可达60.11%的成功率。我们的工作揭示了当前VLM安全机制的根本视觉漏洞,强调需要更强的防御措施。警告:本文包含potentially有害示例文本。

关键词

引用

@article{arxiv.2411.18000,
  title  = {Exploring Visual Vulnerabilities via Multi-Loss Adversarial Search for Jailbreaking Vision-Language Models},
  author = {Shuyang Hao and Bryan Hooi and Jun Liu and Kai-Wei Chang and Zi Huang and Yujun Cai},
  journal= {arXiv preprint arXiv:2411.18000},
  year   = {2024}
}