中文

Dyslexify:针对CLIP中的排版攻击的机械防御

计算机视觉与模式识别 2026-02-27 v2 人工智能

摘要

排版攻击通过向图像中注入文本来利用多模态系统,导致针对性误分类、恶意内容生成甚至Vision-Language模型越狱。在本工作中,我们分析了CLIP视觉编码器在排版攻击下的行为,发现后半部分模型层中存在专门的注意力头能够因果地提取并传递排版信息到cls token。基于这些洞察,我们引入Dyslexify——一种通过选择性剔除注意力头构成的排版电路来防御CLIP模型的方法。无需微调,dyslexify在排版变体ImageNet-100上性能提升最高可达22.06%,而在标准ImageNet-100上的准确率下降不足1%,并在皮肤瘤诊断的医疗基础模型中展示了其实用性。值得注意的是,我们的无训练方法在当前依赖微调的SOTA排版防御方法中保持竞争力。为此,我们发布了一系列dyslexic CLIP模型,这些模型在排版攻击下显著更健壮,适合作为广泛应用中安全关键场景的即插即用替换方案,在此类场景中,基于文本的操纵风险超过文本识别的实用性。

关键词

引用

@article{arxiv.2508.20570,
  title  = {Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP},
  author = {Lorenz Hufe and Constantin Venhoff and Erblina Purelku and Maximilian Dreyer and Sebastian Lapuschkin and Wojciech Samek},
  journal= {arXiv preprint arXiv:2508.20570},
  year   = {2026}
}