PAST2HARM:一种简单自适应的过去时态攻击用于突破多模态 AI
计算与语言
2026-05-28 v1
摘要
多模态 AI 系统的越狱攻击仍属下探讨范畴,尽管不安全的图像生成可能比不安全的文本生成产生更严重的后果,而且当前防御措施也相对不成熟。我们引入 PAST2HARM,一种简单而有效的自适应越狱框架,用于突破领先多模态文本到图像模型的拒绝训练。基于过去时态改写可规避安全措施的先前发现,PAST2HARM 系统性地利用了多模态生成式 AI 中的这一漏洞。我们沿两个维度对该攻击进行特征化。首先,广度:通过时间深化,该框架逐步加强历史锚定和档案线索,侵蚀不同对齐强度模型的拒绝边界。其次,深度:通过初始合规后的迭代升级,我们探索有害生成的上限,使用由语言模型充当评判官的标量严重性越狱指标进行评估。我们发现,中期对话轮次是峰值脆弱性窗口,在此期间有害性会在平台前后升高。我们在 Gemini Nano Banana Pro、GPT Image 2 和 SD XL 三个模型上评估了 PAST2HARM,在黑盒、无梯度的设置下实现了 83%、67% 和 100% 的攻击成功率。对抗性提示在模型之间也能传递,跨模型成功率超过 50%。该攻击诱发多样化的有害输出,包括显性性内容、政治误导、历史否认叙事、仇恨言论和自伤美化等。我们进一步发布了精选的提示、改写版本和输出基准资源,用于红队测试和对齐。我们的结果暴露了当前安全防御的根本脆弱性,凸显了加强多模态安全训练的必要性。
引用
@article{arxiv.2605.27545,
title = {PAST2HARM: A Simple Adaptive Past Tense Attack for Jailbreaking Multimodal AI},
author = {Snehasis Mukhopadhyay},
journal= {arXiv preprint arXiv:2605.27545},
year = {2026}
}