中文

图像劫持:对抗图像可在运行时控制生成模型

机器学习 2024-09-19 v4 计算与语言 密码学与安全

摘要

基础模型是否能够抵御恶意行为者?在本文中,我们关注视觉-语言模型(VLM)的图像输入。我们发现了图像劫持——即在推理时控制 VLM 行为的对抗图像,并提出了用于训练图像劫持的通用行为匹配(Behaviour Matching)算法。由此,我们推导出提示匹配(Prompt Matching)方法,该方法使我们能够使用与所选提示无关的通用现成数据集,训练出匹配任意用户定义文本提示(例如“埃菲尔铁塔现在位于罗马”)行为的劫持图像。我们利用行为匹配针对四类攻击制作劫持图像,迫使 VLM 生成攻击者选定的输出、从其上下文窗口泄露信息、覆盖其安全训练,以及相信虚假陈述。我们针对 LLaVA(一种基于 CLIP 和 LLaMA-2 的先进 VLM)研究了这些攻击,发现所有攻击类型的成功率均超过 80%。此外,我们的攻击是自动化的,且仅需微小的图像扰动。

关键词

引用

@article{arxiv.2309.00236,
  title  = {Image Hijacks: Adversarial Images can Control Generative Models at Runtime},
  author = {Luke Bailey and Euan Ong and Stuart Russell and Scott Emmons},
  journal= {arXiv preprint arXiv:2309.00236},
  year   = {2024}
}

备注

Project page at https://image-hijacks.github.io