BaThe:通过将有害指令视为后门触发器来防御多模态大语言模型中的越狱攻击
密码学与安全
2025-04-23 v3
摘要
多模态大语言模型(MLLMs)在多种多模态任务中展现了令人瞩目的性能。另一方面,额外图像模态的集成可能允许恶意用户在图像中注入有害内容以实现越狱。与基于文本的大语言模型(LLMs)不同,在后者中,攻击者需要使用特定算法选择离散的标记来隐藏其恶意意图,而图像信号的连续性为攻击者直接注入有害意图提供了机会。在这项工作中,我们提出了 BaThe(后门触发器屏障),一种简单而有效的越狱防御机制。我们的工作受到近期关于生成式语言模型中越狱后门攻击和虚拟提示后门攻击研究的启发。越狱后门攻击使用有害指令结合手工制作的字符串作为触发器,使被植入后门的模型生成被禁止的响应。我们假设有害指令可以作为触发器,并且如果我们选择性地将拒绝响应设置为触发响应,那么被植入后门的模型就可以防御越狱攻击。我们通过利用虚拟拒绝提示来实现这一点,类似于虚拟提示后门攻击。我们将虚拟拒绝提示嵌入到软文本嵌入中,我们称之为“楔子”。我们的综合实验表明,BaThe 能有效缓解各种类型的越狱攻击,并能适应防御未见过的攻击,同时对多模态大语言模型的性能影响极小。
引用
@article{arxiv.2408.09093,
title = {BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger},
author = {Yulin Chen and Haoran Li and Yirui Zhang and Zihao Zheng and Yangqiu Song and Bryan Hooi},
journal= {arXiv preprint arXiv:2408.09093},
year = {2025}
}