上下文图像攻击:视觉上下文如何暴露多模态安全漏洞
计算机视觉与模式识别
2025-12-03 v1 计算与语言
密码学与安全
摘要
虽然多模态大语言模型(MLLM)展现出显著的能力,但其安全对齐容易受到越狱攻击。现有攻击方法通常聚焦于文本-图像交互,将视觉模态视为辅助提示。这种方法低估了图像携带复杂上下文信息的独特潜力。为弥补这一空白,我们提出一种新的以图像为中心的攻击方法——上下文图像攻击(CIA),该方法利用多智能体系统,通过四种不同的可视化策略将有害查询微妙地嵌入看似无害的视觉上下文中。为进一步增强攻击效果,该系统结合了上下文元素增强和自动毒性混淆技术。在MMSafetyBench-tiny数据集上的实验结果表明,CIA对GPT-4o和Qwen2.5-VL-72B模型分别取得了4.73和4.83的高毒性分数,攻击成功率(ASR)分别达到86.31%和91.07%。我们的方法显著优于先前工作,证明视觉模态本身是攻破先进MLLM的强大载体。
引用
@article{arxiv.2512.02973,
title = {Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities},
author = {Yuan Xiong and Ziqi Miao and Lijun Li and Chen Qian and Jie Li and Jing Shao},
journal= {arXiv preprint arXiv:2512.02973},
year = {2025}
}