中文

StructBreak:多模态大语言模型结构认知超载引发的安全失效

人工智能 2026-05-26 v1

摘要

多模态大语言模型 (MLLMs) 在结构推理方面表现出色,但在结构一致性方面存在尖锐的逻辑脆弱性。我们称这种现象为结构认知超载 (SCO),是深层推理与安全对齐之间矛盾的副产品。然而,既有工作主要针对排版和像素级扰动,导致 SCO 研究基本缺失。为此,我们提出 StructBreak,一个自动化的端到端框架,用于量化 SCO。通过 StructBreak,我们发现一种新型的高阶认知超载攻击范式;值得注意的是,该攻击在实际黑盒设置下运行,无需内部模型访问。因此,我们利用该框架建立了一个涵盖十个多样化威胁情景的综合基准。对六大主流 MLLMs 的经验评估显示,SCO 能轻易触发有毒生成,平均 ASR 达 92%(至 97% 于 Gemini 2.5)。为阐明 SCO 的机制,我们进一步进行了模型层面的解释,涵盖注意力动态、潜在空间拓扑和几何分析。我们的发现表明,StructBreak 是一种新的结构通道,可用于规避安全过滤器。此外,当前安全机制的有限效果凸显了当前对齐范式在复杂多模态推理时代仍不足。

关键词

引用

@article{arxiv.2605.25534,
  title  = {StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs},
  author = {Yang Luo and Xinran Liu and Tiantian Ji and Zhiyi Yin and Lingyun Peng and Shuyu Li},
  journal= {arXiv preprint arXiv:2605.25534},
  year   = {2026}
}

备注

23 pages; accepted to Findings of ACL 2026. This paper contains examples of harmful content