中文

图像是对齐的脆弱性:利用视觉漏洞劫持多模态大语言模型

计算机视觉与模式识别 2025-01-14 v3 计算与语言

摘要

本文研究了多模态大语言模型 (MLLM) 的无害化对齐问题。我们对代表性 MLLMs 的无害化性能进行了系统实证分析,揭示了图像输入对 MLLMs 对齐漏洞的影响。灵感来自这一发现,我们提出一种新颖的劫持方法,称为 HADES,通过精心制作的图像隐藏并放大文本输入中恶意意图的危害性。实验结果表明,HADES 能够有效劫持现有 MLLMs,LLaVA-1.5 的平均攻击成功率 (ASR) 为 90.26%,Gemini Pro Vision 为 71.60%。我们的代码和数据已公开于 https://github.com/RUCAIBox/HADES。

关键词

引用

@article{arxiv.2403.09792,
  title  = {Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models},
  author = {Yifan Li and Hangyu Guo and Kun Zhou and Wayne Xin Zhao and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2403.09792},
  year   = {2025}
}

备注

ECCV 2024 Oral