中文

Visual-RolePlay: 通过角色扮演图像对多模态大语言模型进行通用越狱攻击

密码学与安全 2024-06-13 v2 人工智能

摘要

随着多模态大语言模型(MLLMs)的出现和广泛部署,确保其安全性变得日益关键。为实现这一目标,我们需要通过探索攻击方法来主动发现MLLMs的脆弱性。因此,基于结构的越狱攻击(将有害语义内容嵌入图像中)被提出以误导模型。然而,先前的基于结构的越狱方法主要侧重于转换恶意查询的格式,例如通过排版将有害内容转换为图像,这缺乏足够的越狱有效性和泛化能力。为解决这些局限性,我们首次将“角色扮演”概念引入MLLM越狱攻击,并提出了一种新颖有效的方法,称为视觉角色扮演(VRP)。具体来说,VRP利用大语言模型生成高风险角色的详细描述,并根据描述创建相应的图像。当与良性的角色扮演指令文本配对时,这些高风险角色图像通过扮演具有负面属性的角色,有效地误导MLLMs生成恶意响应。我们进一步将VRP方法扩展到通用设置中以展示其泛化能力。在流行基准上的大量实验表明,VRP在所有模型上的平均攻击成功率(ASR)比最强基线Query relevant和FigStep高出14.3%。

关键词

引用

@article{arxiv.2405.20773,
  title  = {Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character},
  author = {Siyuan Ma and Weidi Luo and Yu Wang and Xiaogeng Liu},
  journal= {arXiv preprint arXiv:2405.20773},
  year   = {2024}
}