Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey
量子物理
2026-03-31 v1
摘要
多模态大语言模型 (MLLM) 将来自文本、图像、音频和视频等多种模态的信息集成在一起,实现了 visual question answering、audio translation 等复杂能力。虽然这些模型功能强大,但这种 increased expressiveness 引入了新的和放大的对抗操纵的脆弱性。本 survey 提供了对 MLLMs 对抗威胁的全面和系统分析,超越罗列攻击技术,阐释模型易受攻击的根本原因。我们引入一种将攻击者目标分为主导类别的分类框架,统一了跨模态和部署 setting 中的 diverse attack surfaces。此外,我们还提出以 vulnerability 为中心的分析,将 integrity attacks、safety 和 jailbreak failures、control 和 instruction hijacking、以及 training-time poisoning 与多模态系统的 shared architectural 和 representational 弱点相联系。这个 framework 提供了理解 MLLMs 对抗行为的解释性基础,并指导开发更 robust 和 secure 的 multimodal language systems。
引用
@article{arxiv.2603.27917,
title = {Contextuality of quantum non-demolition measurement via state discrimination},
author = {Min Namkung and Ilhwan Kim and Hyang-Tag Lim},
journal= {arXiv preprint arXiv:2603.27917},
year = {2026}
}
备注
16 pages, 5 figures