使每一步均有效:通过分层 KV 均衡越狱大型视觉语言模型
计算机视觉与模式识别
2025-03-18 v1 密码学与安全
摘要
在大型视觉语言模型(LVLMs)领域,对抗性越狱攻击作为一种红队测试方法,用于识别这些模型及其相关防御机制的安全漏洞。然而,我们发现了一个关键局限性:并非每个对抗性优化步骤都会带来积极结果,不加区分地接受每一步的优化结果可能会降低整体攻击成功率。为了应对这一挑战,我们引入了HKVE(分层键值均衡),这是一种创新的越狱框架,它根据不同层之间注意力分数的分布选择性地接受梯度优化结果,确保每个优化步骤都对攻击有积极贡献。大量实验证明了HKVE的显著有效性,在MiniGPT4上实现了75.08%的攻击成功率,在LLaVA上实现了85.84%,在Qwen-VL上实现了81.00%,分别以20.43%、21.01%和26.43%的幅度大幅优于现有方法。此外,使每一步有效不仅提高了攻击成功率,还允许减少迭代次数,从而降低计算成本。警告:本文包含潜在有害的示例数据。
引用
@article{arxiv.2503.11750,
title = {Making Every Step Effective: Jailbreaking Large Vision-Language Models Through Hierarchical KV Equalization},
author = {Shuyang Hao and Yiwei Wang and Bryan Hooi and Jun Liu and Muhao Chen and Zi Huang and Yujun Cai},
journal= {arXiv preprint arXiv:2503.11750},
year = {2025}
}