BlueSuffix:针对越狱攻击的视觉-语言模型强化蓝队防御
计算机视觉与模式识别
2025-02-13 v2 人工智能
机器学习
摘要
本文聚焦于针对越狱攻击的视觉-语言模型(VLM)黑盒防御。现有的黑盒防御方法要么是单模态的,要么是双模态的。单模态方法增强VLM的视觉或语言模块,而双模态方法则通过文本-图像表征重新对齐来增强模型的鲁棒性。然而,这些方法存在两个局限性:1)它们未能充分利用跨模态信息,或2)它们会降低模型在良性输入上的性能。为了解决这些局限性,我们提出了一种新颖的蓝队方法BlueSuffix,该方法能在黑盒设置下防御目标VLM免受越狱攻击,同时不损害其性能。BlueSuffix包含三个关键组件:1)一个针对越狱图像的视觉净化器,2)一个针对越狱文本的文本净化器,以及3)一个使用强化微调来增强跨模态鲁棒性的蓝队后缀生成器。我们在四个VLM(LLaVA、MiniGPT-4、InstructionBLIP和Gemini)和四个安全基准(Harmful Instruction、AdvBench、MM-SafetyBench和RedTeam-2K)上通过实验证明,BlueSuffix的性能显著优于基线防御方法。我们的BlueSuffix为防御VLM免受越狱攻击开辟了一个有前景的方向。代码可在https://github.com/Vinsonzyh/BlueSuffix获取。
引用
@article{arxiv.2410.20971,
title = {BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks},
author = {Yunhan Zhao and Xiang Zheng and Lin Luo and Yige Li and Xingjun Ma and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2410.20971},
year = {2025}
}