中文

每张图都讲述危险的故事:基于记忆增强的多智能体视觉语言模型越狱攻击

人工智能 2026-04-15 v1 多媒体

摘要

视觉语言模型(VLM)的快速发展催化了人工智能方面前所未有的能力;然而,这种持续的模态扩展不慎暴露了极其广泛且无约束的对抗攻击面。当前的多模态越狱策略主要关注表层级的像素扰动和 typographic 攻击或有害图像;然而,它们未能与视觉数据固有的复杂语义结构发生作用。这留下了原始自然图像的广泛语义攻击面未被细致 scrutiny。为了暴露这些深层语义漏洞,我们引入了 **MemJack**——一个 **MEM**ory-augmented multi-agent **JA**ilbreak atta**CK** 框架,**显式地利用视觉语义来 orchestrate 自动化越狱攻击**。MemJack 采用协调的多智能体合作,动态将视觉实体映射到恶意意图,通过多角度视觉-语义伪装生成对抗性提示,并利用迭代 nullspace 投影(INLP)几何滤波器以规避过早的潜在空间拒绝。通过累积和传递成功策略于一个持久的多模态经验记忆中,MemJack 能够在不同图像之间保持高度连贯的长期多轮越狱攻击交互,从而提高对新图像的攻击成功率(ASR)。广泛的实证评估涵盖完整且未经修改的 COCO val2017 数据集,证明 MemJack 在 Qwen3-VL-Plus 上实现 71.48% 的 ASR,并在扩展预算下可达到 90%。此外,为 catalyze 未来防御性对齐研究,我们将发布 **MemJack-Bench**——一个包含超过 113,000 条交互式多模态越狱攻击轨迹的综合数据集,为开发固有健壮 VLMs 奠定了关键基础。

关键词

引用

@article{arxiv.2604.12616,
  title  = {Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs},
  author = {Jianhao Chen and Haoyang Chen and Hanjie Zhao and Haozhe Liang and Tieyun Qian},
  journal= {arXiv preprint arXiv:2604.12616},
  year   = {2026}
}

备注

12 pages, 9 figures