中文

当提示变为视觉:大型图像编辑模型的视觉中心性越狱攻击

计算机视觉与模式识别 2026-02-12 v1 人工智能

摘要

近期大型图像编辑模型的进步正推动从文本驱动指令向视觉提示编辑范式的转变,即从视觉输入(如标记、箭头和视觉文本提示)直接推断用户意图。虽然这一范式大幅提升了可用性,但也引入了一个关键且尚未充分探讨的安全风险:攻击面本身变为视觉形式。本文提出了视觉中心性越狱攻击 (Vision-Centric Jailbreak Attack, VJA),这是一种首次实现的视觉到视觉的越狱攻击,完全通过视觉输入传递恶意指令。为系统性地研究这一新兴威胁,我们引入 IESBench,一个面向图像编辑模型的安全基准。对 IESBench 上大量实验表明,VJA 有效地破坏了领先的商业模型,在 Nano Banana Pro 上实现最高 80.9% 的攻击成功率,在 GPT-Image-1.5 上实现 70.1% 的攻击成功率。为缓解此漏洞,我们提出一种基于内省多模态推理的训练免费防御方案,显著提升了 poorly aligned 模型的安全性,使其达到商业系统水平,无需额外警卫模型且计算开销可忽略不计。我们的发现暴露了新的漏洞,提供了基准与实际防御,以推动安全可信的现代图像编辑系统的发展。警告:本论文包含由大型图像编辑模型生成的冒犯性图像。

关键词

引用

@article{arxiv.2602.10179,
  title  = {When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models},
  author = {Jiacheng Hou and Yining Sun and Ruochong Jin and Haochen Han and Fangming Liu and Wai Kin Victor Chan and Alex Jinpeng Wang},
  journal= {arXiv preprint arXiv:2602.10179},
  year   = {2026}
}

备注

Project homepage: https://csu-jpg.github.io/vja.github.io/