FigStep:通过排版视觉提示越狱大型视觉-语言模型
密码学与安全
2025-01-22 v3 人工智能
计算与语言
摘要
大型视觉-语言模型(LVLMs)标志着人工智能(AI)界一次突破性的范式转变,其通过吸收额外模态(如图像)超越了大型语言模型(LLMs)的能力。尽管有此进展,LVLMs 的安全性仍未被充分探索,且可能过度依赖其底层 LLM 所宣称的安全保证。在本文中,我们提出 FigStep,一种针对 LVLMs 的简洁而有效的黑盒越狱算法。FigStep 不直接输入文本有害指令,而是通过排版将禁止内容转换为图像以绕过安全对齐。实验结果表明,FigStep 在六个有前景的开源 LVLMs 上能达到 82.50% 的平均攻击成功率。我们不仅展示了 FigStep 的有效性,还进行了全面的消融研究并分析语义嵌入的分布,揭示 FigStep 成功背后的原因是视觉嵌入安全对齐的缺失。此外,我们将 FigStep 与五种纯文本越狱和四种基于图像的越狱进行比较,以证明 FigStep 的优越性,即可忽略的攻击成本和更好的攻击性能。总而言之,我们的工作揭示了当前 LVLMs 易受越狱攻击,这凸显了新型跨模态安全对齐技术的必要性。我们的代码和数据集可在 https://github.com/ThuCCSLab/FigStep 获取。
引用
@article{arxiv.2311.05608,
title = {FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts},
author = {Yichen Gong and Delong Ran and Jinyuan Liu and Conglei Wang and Tianshuo Cong and Anyu Wang and Sisi Duan and Xiaoyun Wang},
journal= {arXiv preprint arXiv:2311.05608},
year = {2025}
}
备注
AAAI 2025 (Oral)