Mosaic:面向闭源 VLMs 的多模态越狱攻击
计算机视觉与模式识别
2026-04-13 v1 人工智能
摘要
视觉语言模型(VLMs)虽强大,但仍面临多模态越狱攻击的脆弱性。现有攻击主要依赖显式视觉 prompt 攻击或梯度式对抗优化。前者易被检测,后者产生难以察觉的扰动,但通常在同构的开源代理-目标设置下进行优化与评估,导致其在商业闭源 VLMS 的异构设置下有效性尚不清楚。为调查此问题,我们研究了不同代理-目标设置,发现同构与异构设置之间存在显著差距,称之为代理依赖现象。基于此发现,我们提出 Mosaic,一个针对闭源 VLMS 的多视角集成优化框架,以减少在异构设置下对单一代理模型或单一视角的过度依赖。具体而言,Mosaic 包含三个核心组件:文本侧转换模块,扰动拒绝敏感的词汇模式;多视角图像优化模块,在多样化裁剪视角下更新扰动,以避免对单一视角的过拟合;以及代理集成引导模块,聚合来自多个代理 VLMS 的优化信号,以减少代理特异性偏差。大量实验表明,Mosaic 在商业闭源 VLMS 上实现了最高的攻击成功率和平均毒性指数。
引用
@article{arxiv.2604.09253,
title = {Mosaic: Multimodal Jailbreak against Closed-Source VLMs via Multi-View Ensemble Optimization},
author = {Yuqin Lan and Gen Li and Yuanze Hu and Weihao Shen and Zhaoxin Fan and Faguo Wu and Xiao Zhang and Laurence T. Yang and Zhiming Zheng},
journal= {arXiv preprint arXiv:2604.09253},
year = {2026}
}
备注
14pages, 9 figures