中文

像素间的阅读:文本到图像模型的题写型越狱攻击

计算机视觉与模式识别 2026-04-09 v2

摘要

现代文本到图像(T2I)模型现已能够渲染可读的段落级文本,使一类全新的滥用成为可能。我们识别并形式化了题写型越狱攻击,其中攻击者迫使 T2I 系统生成包含有害文本载荷(如欺诈文件)的图像,这些文本嵌入在视觉上无害的场景中。与传统描绘型越狱攻击(其诱发视觉上令人反感的图像)不同,题写型攻击利用文本渲染能力本身。由于现有的越狱技术旨在进行粗粒度视觉操作,它们难以在保持字符级保真度的同时绕过多级安全过滤器。为了暴露这一漏洞,我们提出了 Etch,一个黑盒攻击框架,将对抗性提示分解为三个功能正交层:语义伪装、视觉-空间锚定和排版编码。这种分解将全提示空间的联合优化简化为可处理的子问题,通过零阶循环迭代优化。在此过程中,视觉-语言模型评估每个生成的图像,将失败定位到特定层,并规定有针对性的修订。在 7 个模型上的广泛评估和 2 个基准测试表明,Etch 实现了平均攻击成功率 65.57%(峰值 91.00%),显著优于现有基线。我们的结果揭示了当前 T2I 安全对齐中的关键盲点,并强调了迫切需要排版感知的防御多模态机制。

关键词

引用

@article{arxiv.2604.05853,
  title  = {Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models},
  author = {Zonghao Ying and Haowen Dai and Lianyu Hu and Zonglei Jing and Quanchen Zou and Yaodong Yang and Aishan Liu and Xianglong Liu},
  journal= {arXiv preprint arXiv:2604.05853},
  year   = {2026}
}

备注

Withdrawn for extensive revisions and inclusion of new experimental results