红队测试GPT-4V:GPT-4V能否抵御单/多模态越狱攻击?
机器学习
2024-12-17 v2 计算与语言
密码学与安全
摘要
目前已提出多种越狱攻击方法对大型语言模型(LLM)进行红队测试,并揭示了LLM脆弱的安全防护。此外,一些方法不局限于文本模态,通过扰动视觉输入将越狱攻击扩展到多模态大型语言模型(MLLM)。然而,缺乏通用的评估基准使得性能复现和公平比较变得复杂。此外,目前也缺乏对闭源的最先进(SOTA)模型(尤其是如GPT-4V等MLLM)的全面评估。为了解决这些问题,本研究首先构建了一个全面的越狱评估数据集,包含涵盖11种不同安全策略的1445个有害问题。基于该数据集,我们在11种不同的LLM和MLLM上进行了广泛的红队测试实验,包括SOTA专有模型和开源模型。随后,我们对评估结果进行了深入分析,发现:(1)与开源LLM和MLLM相比,GPT4和GPT-4V对越狱攻击表现出更好的鲁棒性。(2)与其他开源模型相比,Llama2和Qwen-VL-Chat更具鲁棒性。(3)与文本越狱方法相比,视觉越狱方法的可迁移性相对有限。数据集和代码可在 https://github.com/chenxshuo/RedTeamingGPT4V 找到。
引用
@article{arxiv.2404.03411,
title = {Red Teaming GPT-4V: Are GPT-4V Safe Against Uni/Multi-Modal Jailbreak Attacks?},
author = {Shuo Chen and Zhen Han and Bailan He and Zifeng Ding and Wenqian Yu and Philip Torr and Volker Tresp and Jindong Gu},
journal= {arXiv preprint arXiv:2404.03411},
year = {2024}
}
备注
technical report; update code repo link