中文

JaiLIP:基于损失引导图像扰动的 Vision-Language 模型越狱攻击

计算机视觉与模式识别 2025-10-24 v2

摘要

视觉语言模型(VLM)在生成多模态推理任务方面表现突出。然而,由于不同的攻击向量,VLM 的潜在滥用或安全对齐问题正在显着增加。尽管存在多种攻击向量,但最近的研究表明,图像基于扰动在生成有害输出方面尤其有效。在文献中,已提出许多技术来越狱 VLM,导致性能不稳定且扰动可见。在本研究中,我们提出 Jailbreaking with Loss-guided Image Perturbation(JaiLIP),这是一种针对图像空间的越狱攻击,通过最小化干净图像与对抗图像之间的均方误差(MSE)损失与模型有害输出损失的联合目标来实现。我们在使用来自 Perspective API 和 Detoxify 的标准毒性指标的 VLM 上评估了我们的方法。实验结果表明,我们的方法生成高度有效且难以察觉的对抗图像,在产生毒性方面优于现有方法。此外,我们在交通领域评估了该方法,以演示其在特定领域之外的实际攻击。我们的发现强调了图像基于越狱攻击的实际挑战以及为 VLM 所需的高效防御机制。

关键词

引用

@article{arxiv.2509.21401,
  title  = {JaiLIP: Jailbreaking Vision-Language Models via Loss Guided Image Perturbation},
  author = {Md Jueal Mia and M. Hadi Amini},
  journal= {arXiv preprint arXiv:2509.21401},
  year   = {2025}
}