中文

单次扰动,两种失效模式:通过嵌入引导的排版扰动探讨VLM安全性

计算机视觉与模式识别 2026-04-29 v1

摘要

排版注入攻击利用视觉语言模型(VLM)读取图像中渲染文本的能力,作为VLM驱动自主智能体的日益增长的威胁。先前的工作通常focus于最大化攻击成功率(ASR),但未解释为何某些渲染方式能够规避安全对齐。我们做出两个贡献。首先,跨四个VLM(包括GPT-4o和Claude)、十二种字体大小和十种转换的实证研究揭示,多模态嵌入距离强烈预测ASR(r=0.71r{=}{-}0.710.93{-}0.93p<0.01p{<}0.01),提供了可解释的、模型无关的代理。由于嵌入距离预测ASR,降低它应该改善攻击成功,但这种关系由两个因素中介:感知可读性( VLM是否能够解析文本)和安全对齐(其是否拒绝遵从)。其次,我们将其作为红队工具使用:我们直接在受限\ell_\infty扰动下最大化图像文本嵌入相似性,通过CWA-SSA跨四个替代嵌入模型进行压力测试,无需访问目标模型。实验在GPT-4o、Claude Sonnet 4.5、Mistral-Large-3和Qwen3-VL上的五种降解设置中确认,优化程序在恢复可读性和减少安全对齐拒绝方面发挥作用,这两种效应同时发生,取决于模型安全过滤器强度和视觉降解程度。

关键词

引用

@article{arxiv.2604.25102,
  title  = {One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations},
  author = {Ravikumar Balakrishnan and Sanket Mendapara},
  journal= {arXiv preprint arXiv:2604.25102},
  year   = {2026}
}