中文

超越文本:通过感知简单变换对视觉语言与音频模型实现多模态越狱

密码学与安全 2025-10-24 v1 多媒体

摘要

多模态大语言模型 (MLLM) 取得显著进展,但仍严重脆弱于利用跨模态处理薄弱环节的对抗性攻击。我们系统性地研究针对视觉语言与音频语言模型的多模态越狱,表明即使是简单的感知变换也能可靠绕过领先的安全过滤器。我们的评估覆盖 1,900 条针对三大高风险安全类别的对抗性提示:有害内容、CBRN (化学、生物、放射、核) 及 CSEM (儿童性剥削物料),测试对象为七个前沿模型。我们探讨了攻击技术在 MLLM 上的有效性,包括 FigStep-Pro (视觉关键词分解)、Intelligent Masking (语义遮蔽) 及音频扰动 (Wave-Echo、Wave-Pitch、Wave-Speed)。结果揭示严重脆弱性:几乎完美的文本安全模型 (0% ASR) 在感知修改输入下遭遇 >75% 的攻击成功率,FigStep-Pro 在 Llama-4 变体中最高达 89% ASR。音频攻击进一步暴露了供应商特定的弱点,即便是基础的模态迁移也可实现技术查询的 25% ASR。这些发现凸显了文本中心对齐与多模态威胁之间的关键鸿沟,表明当前安全措施未能在跨模态攻击中普遍适用。攻击的可获取性(仅需极低的技术专业知识)暗示,稳健的多模态 AI 安全将需要向更广泛的语义层次推理范式转变,以缓解可能的风险。

关键词

引用

@article{arxiv.2510.20223,
  title  = {Beyond Text: Multimodal Jailbreaking of Vision-Language and Audio Models through Perceptually Simple Transformations},
  author = {Divyanshu Kumar and Shreyas Jena and Nitin Aravind Birur and Tanay Baswa and Sahil Agarwal and Prashanth Harshangi},
  journal= {arXiv preprint arXiv:2510.20223},
  year   = {2025}
}