中文

寻找面向视觉语言模型的可迁移图像越狱的失败

计算与语言 2024-12-17 v2 人工智能 密码学与安全 计算机视觉与模式识别 机器学习

摘要

将新模态集成到前沿 AI 系统中为提供激动人心的能力,但也增加了这些系统可能以不可希望的方式受到对抗性操纵的可能性。在本工作中,我们关注的是一种流行的视觉语言模型 (VLM) 类,这些模型生成以视觉和文本输入为条件的文本输出。我们进行了大规模实证研究,以评估基于梯度的通用图像“越狱”在超过 40 个开放参数 VLM 之间的可迁移性,其中包括我们公开发布的 18 个新 VLM。总体而言,我们发现基于梯度的可迁移图像越狱极难获得。当图像越狱针对单个 VLM 或针对多个 VLM 的集体优化时,越狱成功地越狱攻击了受攻击的 VLM,但对任何其他 VLM 几乎没有迁移;迁移不受受攻击 VLM 和目标 VLM 是否具有匹配视觉背部或语言模型、语言模型是否进行了指令遵循和/或安全对齐训练,或者其他许多因素的影响。只有两个情境显示出部分成功的迁移:在单个 VLM 的不同训练检查点之间,以及在单个 VLM 的不同训练数据下的 identically-pretrained 和 identically-initialized VLM 之间。利用这些结果,我们然后演示了通过攻击更大的“高度相似” VLM 集合,可以显著提高针对特定目标 VLM 的迁移性。这些结果与现有证据形成鲜明对比,后者显示针对语言模型和针对图像分类器的可迁移对抗攻击表现出普遍和可迁移性,表明 VLM 可能对基于梯度的迁移攻击更健壮。

关键词

引用

@article{arxiv.2407.15211,
  title  = {Failures to Find Transferable Image Jailbreaks Between Vision-Language Models},
  author = {Rylan Schaeffer and Dan Valentine and Luke Bailey and James Chua and Cristóbal Eyzaguirre and Zane Durante and Joe Benton and Brando Miranda and Henry Sleight and John Hughes and Rajashree Agrawal and Mrinank Sharma and Scott Emmons and Sanmi Koyejo and Ethan Perez},
  journal= {arXiv preprint arXiv:2407.15211},
  year   = {2024}
}

备注

NeurIPS 2024 Workshops: RBFM (Best Paper), Frontiers in AdvML (Oral), Red Teaming GenAI (Oral), SoLaR (Spotlight), SATA