中文

通过全局概率优化对扩散视觉语言模型进行越狱

计算机视觉与模式识别 2026-05-12 v2

摘要

扩散视觉语言模型 (dVLMs) 基于扩散大语言模型 (dLLMs) 的非因果基础,已在多模态任务中展现出非寻常的效能,他们已超越了传统自回归生成范式。虽然 dVLMs 似乎对常规越狱战术天然具有鲁棒性,但我们将此类攻击归类为固定前缀优化 (FPO)(例如,以“Sure, here is”等词汇锚定响应),这种鲁棒性是虚假的。我们的调查揭示了 dVLMs 安全领域的独特拒绝模式:立即拒绝与渐进式拒绝。我们发现,FPO-based 攻击往往因触发后者而失败,但渐进式细化过程本身暴露了一种新型、潜在的攻击面。为利用这一漏洞,我们提出全局概率优化 (GPO),一种专为掩码扩散模型的去噪轨迹设计的通用越狱范式。不同于前缀方法,GPO manipulates 全局生成动力学,以绕过扩散语言模型中的警戒。基于此,我们引入 GPO-V,面向 dVLMs 的首个视觉模式越狱框架。经验结果表明,GPO-V 产生的隐蔽扰动具有卓越的跨模型迁移性,揭示了非顺序生成架构中的关键安全漏洞。我们的发现凸显了在 dVLMs 中进行安全对齐的紧迫性,这些结果迫使我们立即和根本性地重新评估当前的防御范式,以缓解扩散生成特有的风险。我们的代码已公开:https://anonymous.4open.science/r/GPO-V-0250。

关键词

引用

@article{arxiv.2605.07399,
  title  = {GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization},
  author = {Yu Pan and Andi Zhang and Yi Wang and Sibei Yang and Wenjie Wang},
  journal= {arXiv preprint arXiv:2605.07399},
  year   = {2026}
}