JailBreakV:评估多模态大语言模型抵御越狱攻击鲁棒性的基准
密码学与安全
2024-11-26 v4 人工智能
计算与语言
摘要
随着多模态大语言模型 (MLLM) 的快速发展,在使这些模型与人类价值观对齐的同时保护其免受恶意输入的攻击,已成为一项关键挑战。在本文中,我们研究了一个重要且尚未探索的问题:成功越狱大语言模型 (LLM) 的技术是否同样能有效地越狱 MLLM。为了探讨这一问题,我们引入了 JailBreakV-28K,这是一个开创性的基准,旨在评估 LLM 越狱技术向 MLLM 的可迁移性,从而评估 MLLM 抵御各种越狱攻击的鲁棒性。利用本文同样提出的包含 2,000 个恶意查询的数据集,我们使用针对 LLM 的高级越狱攻击生成了 20,000 个基于文本的越狱提示,并从近期的 MLLM 越狱攻击中获取了 8,000 个基于图像的越狱输入,我们的综合数据集涵盖了各种对抗场景下的 28,000 个测试用例。我们对 10 个开源 MLLM 的评估显示,从 LLM 迁移而来的攻击具有极高的攻击成功率 (ASR),凸显了 MLLM 中源于其文本处理能力的关键漏洞。我们的研究结果强调,未来研究迫切需要解决 MLLM 中来自文本和视觉输入的对齐漏洞。
引用
@article{arxiv.2404.03027,
title = {JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks},
author = {Weidi Luo and Siyuan Ma and Xiaogeng Liu and Xiaoyu Guo and Chaowei Xiao},
journal= {arXiv preprint arXiv:2404.03027},
year = {2024}
}