Defense-to-Attack:绕过弱防御实现视觉-语言模型中更强的越狱攻击
计算机视觉与模式识别
2025-09-17 v1 人工智能
摘要
尽管视觉-语言模型(VLMs)具有卓越的能力,但它们已被证明容易受到越狱攻击。虽然最近的越狱攻击取得了显著进展,但其有效性和效率仍有提升空间。在这项工作中,我们揭示了一个有趣的现象:将弱防御纳入攻击流程可以显著增强对VLMs越狱攻击的有效性和效率。基于这一洞察,我们提出了Defense2Attack,这是一种新颖的越狱方法,通过利用防御模式来指导越狱提示设计,从而绕过VLMs的安全护栏。具体来说,Defense2Attack包含三个关键组件:(1)一个视觉优化器,嵌入具有肯定和鼓励语义的通用对抗扰动;(2)一个文本优化器,使用防御风格的提示来优化输入;(3)一个红队后缀生成器,通过强化微调来增强越狱效果。我们在四个VLMs和四个安全基准上实证评估了我们的方法。结果表明,Defense2Attack在单次尝试中实现了优越的越狱性能,优于通常需要多次尝试的最先进攻击方法。我们的工作为越狱VLMs提供了新的视角。
引用
@article{arxiv.2509.12724,
title = {Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models},
author = {Yunhan Zhao and Xiang Zheng and Xingjun Ma},
journal= {arXiv preprint arXiv:2509.12724},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication