中文

当记忆成为漏洞:针对文本到图像生成系统的多轮越狱攻击

计算机视觉与模式识别 2026-03-05 v3 密码学与安全

摘要

现代文本到图像(T2I)生成系统(例如 DALL\cdotE 3)利用记忆机制,捕获多轮交互中的关键信息以实现准确生成。尽管其实用性突出,但该机制的安全分析仍严落后。本文揭示了这一机制会加剧越狱攻击的风险。以前的攻击将不安全的目标提示融合到一个最终的对抗性提示中,这种技术容易被检测或导致生成非不安全图像 due to 过度或不足的去 toxicity。相反,我们提出在聊天会话初始阶段嵌入恶意内容,以解决上述局限性。具体而言,我们提出了 Inception,首个针对真实世界文本到图像生成系统的多轮越狱攻击,显式地利用其记忆机制。Inception 由两个关键模块组成:分段和递归。我们引入分段,一种保持语义的生成多轮提示的方法。通过利用 NLP 分析技术,我们设计了政策,将提示及其恶意意图根据句子结构进行分解,从而规避安全过滤器。递归进一步解决了无法通过简单分段分离的不安全子提示的挑战。它首先扩大子提示,然后递归调用分段。为便于多轮对抗性提示制作,我们构建了 VisionFlow,一个集成两阶段安全过滤器和工业级记忆机制的仿真 T2I 系统。实验结果表明,Inception 成功诱导不安全图像生成,攻击成功率超过 SOTA 高出 20.0%。我们还在真实世界商业 T2I 生成平台上进行了实验,进一步验证了 Inception 在实际中的威胁。

关键词

引用

@article{arxiv.2504.20376,
  title  = {When Memory Becomes a Vulnerability: Towards Multi-turn Jailbreak Attacks against Text-to-Image Generation Systems},
  author = {Shiqian Zhao and Jiayang Liu and Yiming Li and Runyi Hu and Xiaojun Jia and Wenshu Fan and Xiao Bao and Xinfeng Li and Jie Zhang and Wei Dong and Tianwei Zhang and Luu Anh Tuan},
  journal= {arXiv preprint arXiv:2504.20376},
  year   = {2026}
}

备注

This work proposes a multi-turn jailbreak attack against real-world chat-based T2I generation systems that intergrate memory mechanism. It also constructed a simulation system, with considering three industrial-grade memory mechanisms, 7 kinds of safety filters (both input and output); It is going to appear on USENIX 2026