面向视觉语言模型的通用且可迁移的越狱攻击
机器学习
2026-02-03 v1 人工智能
计算机视觉与模式识别
摘要
视觉语言模型(VLMs)将视觉编码器扩展至大型语言模型(LLM),使其能够基于图像和文本生成文本。然而,这种多模态集成通过暴露模型于旨在诱发有害响应的图像基础越狱攻击,扩大了攻击面。现有梯度基础的越狱方法迁移性差,因为对抗模式过拟合于单个白盒替代模型,且无法泛化至黑盒模型。本文提出通用且可迁移越狱(UltraBreak)框架,通过在视觉空间施加变换和正则化约束,同时通过语义基础目标放宽文本目标。通过在目标LLM的文本嵌入空间中定义损失,UltraBreak发现跨 diverse 越狱目标泛化的通用对抗模式。这种视觉级正则化与语义引导的文本监督组合,缓解了替代模型的过拟合问题,使其在模型和攻击目标之间实现强迁移。大量实验表明,UltraBreak 持续优于先前的越狱方法。进一步分析揭示了早期方法为何难以迁移,指出通过语义目标平滑损失景观是实现通用且可迁移越狱的关键。我们的代码已公开于 GitHub 仓库。
引用
@article{arxiv.2602.01025,
title = {Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models},
author = {Kaiyuan Cui and Yige Li and Yutao Wu and Xingjun Ma and Sarah Erfani and Christopher Leckie and Hanxun Huang},
journal= {arXiv preprint arXiv:2602.01025},
year = {2026}
}
备注
ICLR 2026