MIRAGE:用于红队越狱攻击的多模态沉浸式推理与引导探索
计算与语言
2025-03-26 v1 密码学与安全
摘要
虽然安全机制在过滤有害文本输入方面取得了显著进展,但多模态大语言模型(MLLM)仍然容易受到利用其跨模态推理能力的多模态越狱攻击。我们提出了MIRAGE,一种新颖的多模态越狱框架,它利用叙事驱动的上下文和角色沉浸来规避多模态大语言模型(MLLM)中的安全机制。通过将恶意查询系统地分解为环境、角色和动作三元组,MIRAGE使用Stable Diffusion构建了一个多轮视觉故事序列的图像和文本,引导目标模型通过一个引人入胜的侦探叙事。这个过程逐步降低模型的防御,并通过结构化的上下文线索巧妙地引导其推理,最终引出有害响应。在选定数据集上对六个主流MLLM进行的大量实验中,MIRAGE实现了最先进的性能,攻击成功率比最佳基线提高了高达17.5%。此外,我们证明角色沉浸和结构化语义重建可以激活模型固有的偏见,促进模型自发违反伦理保障。这些结果突出了当前多模态安全机制的关键弱点,并强调了针对跨模态威胁需要更强大防御的紧迫性。
引用
@article{arxiv.2503.19134,
title = {MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks},
author = {Wenhao You and Bryan Hooi and Yiwei Wang and Youke Wang and Zong Ke and Ming-Hsuan Yang and Zi Huang and Yujun Cai},
journal= {arXiv preprint arXiv:2503.19134},
year = {2025}
}