面向大型视觉语言模型的跨模态混淆:越狱攻击框架
计算与语言
2025-06-23 v1 计算机视觉与模式识别
摘要
大型视觉语言模型(LVLMs)在多模态任务中表现卓越,但仍然容易受到越狱攻击,这些攻击会绕过内置的安全机制以生成受限制的内容。现有的黑盒越狱方法主要依赖对抗性文本提示或图像扰动,但这些方法容易被标准内容过滤系统检测到,且查询效率和计算效率较低。本文提出一种跨模态对抗多模态混淆(CAMO),这是一种新的黑盒越狱攻击框架,将恶意提示分解为语义上良性的视觉和文本碎片。通过利用LVLMs的跨模态推理能力,CAMO通过多步推理隐式地重构恶意指令,从而规避常规检测机制。该方法支持可调的推理复杂度,且所需查询次数显著低于先前攻击,实现了隐蔽性和效率的平衡。对领先LVLMs进行的全面评估表明,CAMO有效且具有强大的跨模型可迁移性。这些结果凸显了当前内置安全机制的严重漏洞,强调在视觉语言系统中亟需更加先进、以对齐为导向的安全与安全解决方案。
引用
@article{arxiv.2506.16760,
title = {Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models},
author = {Lei Jiang and Zixun Zhang and Zizhou Wang and Xiaobing Sun and Zhen Li and Liangli Zhen and Xiaohua Xu},
journal= {arXiv preprint arXiv:2506.16760},
year = {2025}
}
备注
15 pages, 9 figures