ARGUS:针对多模态间接 Prompt 注入通过引导指令遵循行为进行防御
密码学与安全
2025-12-08 v1 多媒体
摘要
多模态大语言模型 (MLLM) 正日益暴露于多模态间接 Prompt 注入 (IPI) 攻击,这类攻击将恶意指令嵌入图像、视频或音频,以劫持模型行为。现有防御措施主要为文本专用 LLM 设计,不适用于对抗这些多模态威胁,因而容易被绕过、依赖于模态或难以普遍化。灵感来源于激活驾驭研究,我们假设可以通过在表示空间中驾驭模型行为来实现一种对模态无关且稳健的防御。通过大量实验,我们发现 MLLM 的指令遵循行为编码于一个子空间中。在该子空间中的方向上进行驾驭可强制执行用户指令,形成防御的基础。然而,我们也发现,一个朴素的防御方向可能与效用降低方向耦合,过度的干预强度会损害模型性能。为此,我们提出了 ARGUS,该方案在安全子空间中搜索最优防御方向,以实现与效用降低方向的解耦,进而结合自适应强度驾驭,以实现更好的安全-效用权衡。ARGUS 还引入轻量级注入检测阶段以按需激活防御,以及后置过滤阶段以验证防御效果。实验结果表明,ARGUS 能在最大限度保留 MLLM 效用的情况下,对抗多模态 IPI 实现稳健防御。
引用
@article{arxiv.2512.05745,
title = {ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior},
author = {Weikai Lu and Ziqian Zeng and Kehua Zhang and Haoran Li and Huiping Zhuang and Ruidong Wang and Cen Chen and Hao Peng},
journal= {arXiv preprint arXiv:2512.05745},
year = {2025}
}