视觉上下文攻击:通过图像驱动上下文注入越狱多模态大语言模型
计算机视觉与模式识别
2025-09-17 v2 计算与语言
密码学与安全
摘要
随着强大的视觉语言能力的出现,多模态大语言模型(MLLMs)在现实世界应用中展现出巨大潜力。然而,视觉模态表现出的安全漏洞对在开放世界环境中部署此类模型构成了重大挑战。最近的研究通过将有害文本语义直接编码到视觉输入中,成功诱导了目标MLLMs的有害响应。然而,在这些方法中,视觉模态主要充当不安全行为的触发器,通常表现出语义模糊性,并且缺乏在现实场景中的基础。在这项工作中,我们定义了一个新的设置:以视觉为中心的越狱,其中视觉信息作为构建完整且现实的越狱上下文的必要组成部分。基于此设置,我们提出了VisCo(视觉上下文)攻击。VisCo使用四种不同的以视觉为中心的策略构建上下文对话,在必要时动态生成辅助图像以构建以视觉为中心的越狱场景。为了最大化攻击效果,它结合了自动毒性混淆和语义细化,以生成最终的攻击提示,可靠地触发目标黑盒MLLMs的有害响应。具体来说,VisCo在MM-SafetyBench上针对GPT-4o实现了4.78的毒性分数和85%的攻击成功率(ASR),显著优于基线(毒性分数2.48,ASR 22.2%)。代码:https://github.com/Dtc7w3PQ/Visco-Attack。
引用
@article{arxiv.2507.02844,
title = {Visual Contextual Attack: Jailbreaking MLLMs with Image-Driven Context Injection},
author = {Ziqi Miao and Yi Ding and Lijun Li and Jing Shao},
journal= {arXiv preprint arXiv:2507.02844},
year = {2025}
}
备注
Accepted to EMNLP 2025 (Main). 17 pages, 7 figures