中文

aptive 逃离有害内容:针对视觉语言模型对抗攻击的自适应防御方法

计算机视觉与模式识别 2025-05-05 v3 人工智能

摘要

视觉语言模型(VLMs)在面对对抗性攻击时可能生成意外且有害内容,特别是由于其视觉能力创造了新的漏洞。现有的防御措施,如输入预处理、对抗训练和基于响应评估的方法,往往因高昂成本而难以在实际部署中应用。为解决这一挑战,我们提出了 ASTRA(Adaptive Steering for robust defense of Vision-language models against adversarial attacks)——一种高效且有效的防御方法,通过自适应地将模型引导 away 于对抗特征方向以抵抗 VLM 攻击。我们的关键步骤包括寻找代表有害响应方向的可迁移引导向量,并在推理时应用自适应激活引导以消除这些方向。为创建有效的引导向量,我们随机剔除对抗图像中的视觉令牌,并识别与越狱最强关联的令牌。这些令牌随后用于构建引导向量。在推理过程中,我们执行涉及引导向量与校准激活之间投影的自适应引导方法,既在善意输入上几乎不产生性能下降,又在对抗输入下能强力避免有害输出。广泛的实验表明,我们的方法在缓解越狱风险方面表现出领先水平和高效能。此外,ASTRA 具备良好的迁移性,能够防御未见过的攻击(即基于结构的攻击、使用投射梯度下降变体的扰动型攻击以及仅文本的攻击)。我们的代码已公开于 \url{https://github.com/ASTRAL-Group/ASTRA}。

关键词

引用

@article{arxiv.2411.16721,
  title  = {Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks},
  author = {Han Wang and Gang Wang and Huan Zhang},
  journal= {arXiv preprint arXiv:2411.16721},
  year   = {2025}
}