中文

同一模型,不同弱点:语言与模态如何重塑前沿多模态大语言模型的越狱攻击面

计算与语言 2026-05-25 v1

摘要

多模态大语言模型(MLLM)的攻击面具有语言依赖性,其方式揭示了对齐失败的机制结构。我们提出了首个系统性的跨语言、多模态红队测试研究,比较了四种前沿 MLLM 在美国英语(en-US)和墨西哥西班牙语(es-MX)下的越狱脆弱性:Claude Sonnet 4.5、GPT-5、Pixtral Large 和 Qwen Omni。使用包含 363 种多样提示场景的固定对抗性基准,在纯文本和多模态条件下进行测试,我们从每组语言九名母语标注者组成的匹配小组中收集了 52,272 个危害评级和二元攻击成功判断。我们的核心发现是,语言并不会均匀地缩放脆弱性。贝叶斯混合效应分析表明,诸如角色扮演等语言框架攻击在西班牙语提示下效果显著降低,而视觉显式多模态攻击则变得更为有效,这直接指向提示语言界面而非标注者的全局宽容度。这种分离表明,语言和视觉对齐失败通过不同的机制发生,仅仅切换语言就足以暴露这种分离。其实际后果是,安全排名在不同语言间无法保持。在 es-MX 参与者中,Qwen Omni 超越 Pixtral Large 成为最脆弱的模型,这种排名逆转是英语条件下分数的任何标量校正都无法恢复的,并且绝对攻击成功率在各代模型间有所下降,但模型间的差距并未缩小。这些发现表明,将语言和模态视为独立维度的安全评估框架从根本上错误地刻画了全球部署 MLLM 的攻击面,必须予以重新设计。

关键词

引用

@article{arxiv.2605.23157,
  title  = {Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs},
  author = {Casey Ford and Madison Van Doren and Sicheng Jin and Emily Dix},
  journal= {arXiv preprint arXiv:2605.23157},
  year   = {2026}
}