语义路由:通过单一对抗扰动劫持多模态大语言模型的可行性研究
计算机视觉与模式识别
2026-01-30 v2 人工智能
密码学与安全
摘要
多模态大语言模型(MLLMs)正日益被部署于无状态系统中,如自动驾驶和机器人领域。本文探讨了一种新型威胁:语义感知劫持。我们研究了是否可以使用单一通用扰动同时劫持多个无状态决策的可能性。我们引入语义感知通用扰动(SAUP),其作为语义路由,“主动”感知输入语义并将其路由到特定的攻击者定义目标。为实现这一目标,我们对潜在空间中的几何属性进行了理论和实证分析。基于这些洞见,我们提出了语义导向(SORT)优化策略,并标注了一套带有细粒度语义的新数据集以进行性能评估。在三个具有代表性的 MLLMs 上进行大量实验,证明了这一攻击的根本可行性,在 Qwen 上使用单帧即可实现对五个目标的 66% 攻击成功率。
引用
@article{arxiv.2511.20002,
title = {Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation},
author = {Changyue Li and Jiaying Li and Youliang Yuan and Jiaming He and Zhicong Huang and Pinjia He},
journal= {arXiv preprint arXiv:2511.20002},
year = {2026}
}