中文

图生文逻辑越狱:你的想象力能帮你做任何事

密码学与安全 2024-08-28 v2 计算机视觉与模式识别

摘要

诸如 GPT-4V 之类的大型视觉语言模型在生成全面且细致的响应方面取得了显著成功。研究人员提出了各种基准来评估 VLMs 的能力。随着 VLMs 中视觉与文本输入的整合,新的安全问题随之出现,因为恶意攻击者可以利用多种模态来实现其目标。这导致人们越来越关注 VLMs 遭受越狱攻击的脆弱性。现有的大多数研究集中在生成对抗性图像或无意义图像以对这些模型进行越狱。然而,没有研究人员评估 VLMs 在流程图中的逻辑理解能力是否会影响越狱。因此,为了填补这一空白,本文首先引入了一个新颖的数据集 Flow-JD,专门设计用于评估 VLMs 基于逻辑的流程图越狱能力。我们在 GPT-4o、GPT-4V 以及其他 5 个 SOTA 开源 VLMs 上进行了广泛评估,越狱率高达 92.8%。我们的研究揭示了当前 VLMs 在图生文越狱方面存在显著漏洞,这些发现强调了未来开发稳健有效防御措施的紧迫性。

关键词

引用

@article{arxiv.2407.02534,
  title  = {Image-to-Text Logic Jailbreak: Your Imagination can Help You Do Anything},
  author = {Xiaotian Zou and Ke Li and Yongkang Chen},
  journal= {arXiv preprint arXiv:2407.02534},
  year   = {2024}
}