Con Instruction:通过非文本模态对多模态大语言模型进行通用越狱
密码学与安全
2025-06-03 v1 计算与语言
机器学习
摘要
现有针对多模态语言模型(MLLM)的攻击主要通过伴随对抗图像的文本指令进行沟通。相反,我们利用 MLLM 解释非文本指令的能力,具体为由我们新方法生成的对抗图像或音频,Con Instruction。我们优化这些对抗性示例以在嵌入空间中与目标指令紧密对齐,揭示了 MLLM 复杂理解能力的不利影响。不同于先前工作,我们的方法无需训练数据或文本指令的预处理。虽然这些非文本对抗性示例能够有效绕过 MLLM 安全机制,但其与各种文本输入的组合会显著放大攻击成功率。我们进一步引入了新的攻击响应分类(ARC)框架,对模型响应的质量及其与恶意指令的相关性进行评估。实验结果表明,Con Instruction 在包括 LLaVA-v1.5、InternVL、Qwen-VL 和 Qwen-Audio 在内的多个视觉和音频语言模型中均能有效绕过安全机制,在两个标准基准(AdvBench 和 SafeBench)上实现最高的攻击成功率:LLaVA-v1.5(13B)上分别达到 81.3% 和 86.6%。在防御方面,我们探讨了针对这些攻击的各种对策,发现现有技术之间存在显著的性能差距。我们的实现已公开发布。
引用
@article{arxiv.2506.00548,
title = {Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities},
author = {Jiahui Geng and Thy Thy Tran and Preslav Nakov and Iryna Gurevych},
journal= {arXiv preprint arXiv:2506.00548},
year = {2025}
}