解读像素之间:文本-图像嵌入对齐与视觉语言模型排版攻击成功率的关联
计算机视觉与模式识别
2026-04-16 v2
摘要
我们研究了视觉语言模型(VLM)上的排版提示注入攻击,其中对抗性文本被渲染为图像以绕过安全机制。随着VLM作为自主智能体(从浏览器自动化和计算机使用系统到配备摄像头的具身智能体)的感知骨干,这种威胁日益增长。在实践中,攻击面是异质的:对抗性文本以不同的字体大小和多样的视觉条件出现,而不断增长的VLM生态系统在脆弱性方面表现出显著差异,使防御方法复杂化。我们在四个VLM(即GPT-4o、Claude Sonnet 4.5、Mistral-Large-3和Qwen3-VL-4B-Instruct)上,针对SALAD-Bench中的1000个提示,在变化的字体大小(6-28像素)和视觉变换(旋转、模糊、噪声、对比度变化)下进行评估,我们发现:(1)字体大小显著影响攻击成功率(ASR),非常小的字体(6像素)导致ASR接近零,而中等范围的字体达到峰值效果;(2)对于GPT-4o(36%对8%)和Claude(47%对22%),文本攻击比图像攻击更有效,而Qwen3-VL和Mistral在两种模态上显示出相当的ASR;(3)来自两个多模态嵌入模型(JinaCLIP和Qwen3-VL-Embedding)的文本-图像嵌入距离与所有四个模型的ASR呈强负相关(r = -0.71至-0.93,p < 0.01);(4)重度退化使嵌入距离增加10-12%,并将ASR降低34-96%,而旋转对模型的影响不对称(Mistral下降50%,GPT-4o不变)。这些发现突显了模型特定的鲁棒性模式排除了通用防御,并为在对抗性环境中运行智能体系统的从业者选择VLM骨干提供了经验指导。
引用
@article{arxiv.2604.12371,
title = {Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models},
author = {Ravikumar Balakrishnan and Sanket Mendapara and Ankit Garg},
journal= {arXiv preprint arXiv:2604.12371},
year = {2026}
}
备注
Accepted at ICLR 2026 Workshop on Agents in the Wild