局部化再中和:基于梯度的令牌抑制对抗视觉提示注入攻击
机器学习
2026-05-26 v1
摘要
对抗图像通过提示注入构成了多模态大语言模型的严重安全威胁。现有防御方法缺乏对底层机制的原则性理解,同时在效率与防御实用性之间难以平衡。本文表明,成功的对抗攻击并不依赖于整个图像的均匀贡献,而是依赖于关键图像子集中的少数令牌。基于此洞察,我们提出了梯度令牌掩码 (Gradient Token Masking, GTM),通过梯度分析定位这些令牌并通过掩码中和实现抑制。我们发现,基于第一个生成令牌输出概率的归因方法在攻击保留预测令牌时会失效。为克服这一问题,GTM利用隐藏状态梯度范数得分进行生成影响归因。我们证明,其排序与完整对抗损失梯度的排序一致,为准确局部化提供了理论保证。该方法仅需一次前向-反向传播即可识别并清零少数高分令牌,有效中断对抗攻击路径。大量实验表明,在提示注入和多模态越狱攻击场景中,我们的方法可将攻击成功率 (ASR) 降至接近零,同时以极小的计算开销保持模型实用性。
引用
@article{arxiv.2605.25194,
title = {Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack},
author = {Dongpeng Zhang and Ke Ma and Yangbangyan Jiang and Gaozheng Pei and Longtao Huang and Qianqian Xu and Qingming Huang},
journal= {arXiv preprint arXiv:2605.25194},
year = {2026}
}