UniGuard:面向多模态大语言模型越狱攻击的通用安全护栏
计算与语言
2025-02-03 v2 人工智能
机器学习
摘要
多模态大语言模型(MLLM)革新了视觉-语言理解,但仍然容易受到多模态越狱攻击的攻击,其中对抗性输入被精心设计以引发有害或不适当的响应。我们提出了UniGuard,一种新型的多模态安全护栏,同时考虑单模态和跨模态有害信号。UniGuard训练一个多模态护栏,以最小化在有害语料库中生成有害响应的可能性。该护栏可以在推理过程中无缝应用于任何输入提示,且计算成本极低。大量实验证明了UniGuard在多种模态、攻击策略和多个最先进MLLM(包括LLaVA、Gemini Pro、GPT-4o、MiniGPT-4和InstructBLIP)上的泛化能力。值得注意的是,这种稳健的防御机制保持了模型的整体视觉-语言理解能力。
引用
@article{arxiv.2411.01703,
title = {UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models},
author = {Sejoon Oh and Yiqiao Jin and Megha Sharma and Donghyun Kim and Eric Ma and Gaurav Verma and Srijan Kumar},
journal= {arXiv preprint arXiv:2411.01703},
year = {2025}
}
备注
14 pages