基于隐喻的文本到图像模型越狱攻击
计算机视觉与模式识别
2025-12-12 v1
摘要
文本到图像(T2I)模型通常包含防御机制,以防止生成敏感图像。不幸的是,最近的越狱攻击表明,对抗提示可以有效绕过这些防御机制并诱导T2I模型生成敏感内容,揭示了关键安全漏洞。然而,现有攻击方法隐含地假设攻击者知道部署防御的类型,这限制了其针对未知或多样化防御机制的有效性。在本工作中,我们揭示了T2I模型对隐喻-based越狱攻击(MJA)的未被充分利用的漏洞,这些攻击旨在通过生成隐喻-based对抗提示而无需对防御类型进行先验知识即可攻击多样化的防御机制。具体而言,MJA包含两个模块: LLM-based多智能体生成模块(LMAG)和对抗提示优化模块(APO)。LMAG将隐喻-based对抗提示的生成分解为三个子任务: 隐喻检索、上下文匹配和对抗提示生成。随后,LMAG协调三个LLM-based智能体,通过探索各种隐喻和上下文生成多样化的对抗提示。为提高攻击效率,APO首先训练一个surrogate模型来预测对抗提示的攻击结果,然后设计获取策略以适应性地识别最佳对抗提示。对T2I模型进行大量实验,包括各种外部和内部防御机制,表明MJA在使用更少查询次数的情况下实现了比六个基线方法更强的攻击性能。此外,我们提供了深入的漏洞分析,表明隐喻-based对抗提示通过诱导语义模糊来规避安全机制,而敏感图像则源于模型对隐藏语义的概率解释。
引用
@article{arxiv.2512.10765,
title = {Blood Pressure Prediction for Coronary Artery Disease Diagnosis using Coronary Computed Tomography Angiography},
author = {Rene Lisasi and Michele Esposito and Chen Zhao},
journal= {arXiv preprint arXiv:2512.10765},
year = {2025}
}
备注
19 pages, 9 figures