大型视觉语言模型面对通过视觉提示注入实现目标劫持的实证分析
计算与语言
2024-08-08 v1 密码学与安全
机器学习
摘要
我们探讨了视觉提示注入(VPI),它滥用大型视觉语言模型(LVLMs)遵循输入图像上绘制指令的能力。我们提出了一种新的 VPI 方法,即通过视觉提示注入实现目标劫持(GHVPI),该方法将 LVLMs 的执行任务从原始任务交换到攻击者指定的替代任务。定量分析表明,GPT-4V 对 GHVPI 具有 15.8% 的攻击成功率,这是一个不可忽视的安全风险。我们的分析还显示,成功的 GHVPI 需要 LVLMs 具备高的字符识别能力和指令遵循能力。
引用
@article{arxiv.2408.03554,
title = {Empirical Analysis of Large Vision-Language Models against Goal Hijacking via Visual Prompt Injection},
author = {Subaru Kimura and Ryota Tanaka and Shumpei Miyawaki and Jun Suzuki and Keisuke Sakaguchi},
journal= {arXiv preprint arXiv:2408.03554},
year = {2024}
}
备注
8 pages, 6 figures, Accepted to NAACL 2024 SRW