中文

大型视觉语言模型面对通过视觉提示注入实现目标劫持的实证分析

计算与语言 2024-08-08 v1 密码学与安全 机器学习

摘要

我们探讨了视觉提示注入(VPI),它滥用大型视觉语言模型(LVLMs)遵循输入图像上绘制指令的能力。我们提出了一种新的 VPI 方法,即通过视觉提示注入实现目标劫持(GHVPI),该方法将 LVLMs 的执行任务从原始任务交换到攻击者指定的替代任务。定量分析表明,GPT-4V 对 GHVPI 具有 15.8% 的攻击成功率,这是一个不可忽视的安全风险。我们的分析还显示,成功的 GHVPI 需要 LVLMs 具备高的字符识别能力和指令遵循能力。

关键词

引用

@article{arxiv.2408.03554,
  title  = {Empirical Analysis of Large Vision-Language Models against Goal Hijacking via Visual Prompt Injection},
  author = {Subaru Kimura and Ryota Tanaka and Shumpei Miyawaki and Jun Suzuki and Keisuke Sakaguchi},
  journal= {arXiv preprint arXiv:2408.03554},
  year   = {2024}
}

备注

8 pages, 6 figures, Accepted to NAACL 2024 SRW