中文

基于视觉语言模型的隐式越狱攻击:跨模态信息隐蔽

机器学习 2025-05-23 v1

摘要

多模态大语言模型(MLLM)实现了强大的跨模态推理能力。然而,扩大的输入空间引入了新的攻击面。以往的越狱攻击常通过文本向视觉等较不对齐的模态注入恶意指令。随着MLLM日益采用跨模态一致性和对齐机制,这类显式攻击变得更容易检测和阻止。本 work 提出一种名为IJA的新型隐式越狱框架,通过最小二阶位隐写术将恶意指令嵌入图像,并搭配看似善意、与图像相关的文本提示。为进一步提升跨 diverse MLLMs 的攻击效果,我们引入由代理模型生成的对抗后缀,并引入模板优化模块,迭代细化提示和嵌入以获得模型反馈。在GPT-4o和Gemini-1.5 Pro等商业模型上,本方法仅需平均3个查询即可实现超过90%的攻击成功率。

关键词

引用

@article{arxiv.2505.16446,
  title  = {Implicit Jailbreak Attacks via Cross-Modal Information Concealment on Vision-Language Models},
  author = {Zhaoxin Wang and Handing Wang and Cong Tian and Yaochu Jin},
  journal= {arXiv preprint arXiv:2505.16446},
  year   = {2025}
}