中文

STaR-Attack:面向统一多模态理解与生成模型的时空-叙事推理攻击框架

人工智能 2025-10-01 v1

摘要

统一多模态理解与生成模型 (UMMs) 在理解与生成任务中展现出惊人的能力。然而,我们发现了一种源于 UMMs 生成-理解耦合的漏洞。攻击者可利用生成函数精心构建信息丰富的对抗图像,然后通过理解函数在单次传递中吸收其信息,我们称之为跨模态生成注入 (CMGI)。当前针对恶意指令的攻击方法常限于单一模态,同时依赖语义漂移的改写,未能探索 UMMs 的独特漏洞。我们提出 STaR-Attack,首个无语义漂移的多轮越狱攻击框架,利用 UMMs 的独特安全弱点。具体方法定义一个在时空语境下与目标查询强相关的恶意事件,依据三幕叙事理论生成前情与后情景,同时将恶意事件隐含为隐藏的高潮。在攻击执行时,前两轮利用 UMM 的生成能力为这些情景生成图像。随后引入基于图像的猜测与回答游戏,通过利用理解能力,将原始恶意问题嵌入良性选项中,迫使模型在叙事语境下选择并回答最相关的选项。大量实验表明,STaR-Attack 在所有测试上均优于先前方法,在 Gemini-2.0-Flash 上实现最高 93.06% 的 ASR,并超越了最强的基线 FlipAttack。我们的工作揭示了 UMMs 中的一个关键且尚未充分发展的漏洞,凸显了在 UMMs 中进行安全对齐的必要性。

引用

@article{arxiv.2509.26473,
  title  = {STaR-Attack: A Spatio-Temporal and Narrative Reasoning Attack Framework for Unified Multimodal Understanding and Generation Models},
  author = {Shaoxiong Guo and Tianyi Du and Lijun Li and Yuyao Wu and Jie Li and Jing Shao},
  journal= {arXiv preprint arXiv:2509.26473},
  year   = {2025}
}