VisualDAN:利用视觉驱动的 DAN 命令暴露视觉语言模型的脆弱性
密码学与安全
2025-10-14 v1 人工智能
摘要
视觉语言模型(Vision-Language Models, VLMs)因其解读与生成多模态内容的卓越能力而备受关注。然而,防御此类模型免遭越狱攻击仍是一项重大挑战。与纯文本模型不同,VLMs 融合了额外的模态,从而引入了图像劫持等新型漏洞,这些漏洞可操纵模型生成不当或有害的响应。受文本越狱(如"Do Anything Now"(DAN)命令)的启发,本文提出 VisualDAN——一种嵌入 DAN 风格命令的单张对抗图像。具体而言,我们在有害语料前添加肯定性前缀(例如"Sure, I can provide the guidance you need"),以诱使模型对恶意查询作出积极响应。随后,对抗图像在这些 DAN 风格有害文本上进行训练,并被转换至文本域以引出恶意输出。在 MiniGPT-4、MiniGPT-v2、InstructBLIP 和 LLaVA 等模型上的大量实验表明,VisualDAN 能有效绕过对齐 VLM 的安全防护,迫使其执行大量严重违反伦理标准的有害指令。我们的结果进一步表明,即使少量有毒内容也能够在模型防御被突破后显著放大有害输出。这些发现凸显了针对基于图像的攻击构建鲁棒防御的迫切必要性,并为未来 VLM 对齐与安全研究提供了关键启示。
引用
@article{arxiv.2510.09699,
title = {VisualDAN: Exposing Vulnerabilities in VLMs with Visual-Driven DAN Commands},
author = {Aofan Liu and Lulu Tang},
journal= {arXiv preprint arXiv:2510.09699},
year = {2025}
}