Zer0-Jack: 一种面向黑盒多模态大语言模型的内存高效梯度越狱方法
机器学习
2026-01-28 v2 人工智能
摘要
越狱方法能诱导多模态大语言模型(MLLM)输出有害响应,引发重大安全担忧。其中,基于梯度的方法利用梯度生成恶意提示词,因在白盒设置(可完全访问模型)下攻击成功率高而被广泛研究。然而,这些方法存在显著局限:需要白盒访问(并非总是可行),且内存占用高。为应对无法获得白盒访问的场景,攻击者常采用迁移攻击。迁移攻击中,利用白盒模型生成的恶意输入被应用于黑盒模型,但通常会导致攻击性能下降。为克服这些挑战,我们提出 Zer0-Jack,该方法利用零阶优化绕过白盒访问需求。我们提出补丁坐标下降以高效生成恶意图像输入,直接攻击黑盒 MLLM,进一步显著降低内存占用。通过大量实验,Zer0-Jack 在多种模型上实现高攻击成功率,超越以往基于迁移的方法,并与现有白盒越狱技术表现相当。值得注意的是,Zer0-Jack 在黑盒设置下于 Harmful Behaviors Multi-modal Dataset 上对 MiniGPT-4 达到 95% 攻击成功率,证明了其有效性。此外,我们展示 Zer0-Jack 可直接攻击 GPT-4o 等商业 MLLM。代码见补充材料。
引用
@article{arxiv.2411.07559,
title = {Zer0-Jack: A Memory-efficient Gradient-based Jailbreaking Method for Black-box Multi-modal Large Language Models},
author = {Tiejin Chen and Kaishen Wang and Hua Wei},
journal= {arXiv preprint arXiv:2411.07559},
year = {2026}
}
备注
Accepted to EACL 2026 Main