中文

视觉大语言模型可被自身生成的排版攻击欺骗

计算机视觉与模式识别 2025-02-14 v3 密码学与安全 机器学习

摘要

排版攻击(在图像中添加误导性文本)可以欺骗视觉语言模型(LVLM)。最近的大型LVLM(如GPT4-V)对此类攻击的敏感性研究不足,这引发了人们对个人助理应用中放大错误信息的担忧。先前的攻击使用简单策略(如随机误导词),未能充分利用LVLM的语言推理能力。我们引入了一个测试LVLM上排版攻击的实验设置,并提出了两种新颖的自身生成攻击:(1)基于类别的攻击,模型识别相似类别以欺骗自身;(2)推理攻击,高级LVLM建议结合欺骗类别和描述的攻击。我们的实验表明,这些攻击显著降低了分类性能(高达60%),并且在不同模型(包括InstructBLIP和MiniGPT4)上均有效。代码:https://github.com/mqraitem/Self-Gen-Typo-Attack

关键词

引用

@article{arxiv.2402.00626,
  title  = {Vision-LLMs Can Fool Themselves with Self-Generated Typographic Attacks},
  author = {Maan Qraitem and Nazia Tasnim and Piotr Teterwak and Kate Saenko and Bryan A. Plummer},
  journal= {arXiv preprint arXiv:2402.00626},
  year   = {2025}
}