基于视觉语言模型的隐式越狱攻击:跨模态信息隐蔽
机器学习
2025-05-23 v1
摘要
多模态大语言模型(MLLM)实现了强大的跨模态推理能力。然而,扩大的输入空间引入了新的攻击面。以往的越狱攻击常通过文本向视觉等较不对齐的模态注入恶意指令。随着MLLM日益采用跨模态一致性和对齐机制,这类显式攻击变得更容易检测和阻止。本 work 提出一种名为IJA的新型隐式越狱框架,通过最小二阶位隐写术将恶意指令嵌入图像,并搭配看似善意、与图像相关的文本提示。为进一步提升跨 diverse MLLMs 的攻击效果,我们引入由代理模型生成的对抗后缀,并引入模板优化模块,迭代细化提示和嵌入以获得模型反馈。在GPT-4o和Gemini-1.5 Pro等商业模型上,本方法仅需平均3个查询即可实现超过90%的攻击成功率。
引用
@article{arxiv.2505.16446,
title = {Implicit Jailbreak Attacks via Cross-Modal Information Concealment on Vision-Language Models},
author = {Zhaoxin Wang and Handing Wang and Cong Tian and Yaochu Jin},
journal= {arXiv preprint arXiv:2505.16446},
year = {2025}
}