Safety-Potential剪枝:无需重新训练提升VLM安全提示抗Jailbreaking能力
计算机视觉与模式识别
2026-03-17 v1
摘要
安全提示构成了视觉语言模型(VLM)防御Jailbreaking攻击的可解释防御层,但其有效性受限于模型的潜在结构响应性。我们观察到,这类提示始终会激活稀疏的参数集合,这些参数在良性使用时几乎处于静默状态。这一发现促使我们提出Safety子网络假设:VLM内置结构上不同的路径能够实现安全控制,但在没有明确刺激下,这些路径保持 dormant 状态。为显现并放大这些路径,我们引入Safety-Potential剪枝,一种无需额外重新训练的单次剪枝框架,通过去除对安全提示不够敏感的权重来放大与安全相关的激活。我们在三个代表性VLM架构和三个Jailbreaking基准测试上测试了该方法,结果显示相对于仅使用提示,本方法在攻击成功率上可降低最高22%,同时保持强大的良性性能。我们的发现将剪枝不仅界定为模型压缩技术,更界定为一种结构性干预,以显现alignment相关子网的潜力,为实现稳健的Jailbreaking抗性提供了新路径。
引用
@article{arxiv.2603.14219,
title = {Safety-Potential Pruning for Enhancing Safety Prompts Against VLM Jailbreaking Without Retraining},
author = {Chongxin Li and Hanzhang Wang and Lian Duan},
journal= {arXiv preprint arXiv:2603.14219},
year = {2026}
}
备注
Accepted for publication in Transactions of the Association for Computational Linguistics (TACL)