中文

VEAttack:面向大视觉语言模型的下游无关视觉编码器攻击

计算机视觉与模式识别 2026-02-05 v2

摘要

大视觉语言模型(LVLMs)在多模态理解和生成方面展现了显著能力,但其对对抗攻击的脆弱性引发了严重的鲁棒性担忧。虽然现有有效的攻击方法始终聚焦于任务特定的白盒设置,但这些方法在LVLMs的背景下受到限制,因为LVLMs被设计用于多样化的下游任务,且需要昂贵的全模型梯度计算。受LVLMs中视觉编码器的关键作用和广泛采用的启发,我们提出了一种简单而有效的视觉编码器攻击(VEAttack),仅针对LVLMs的视觉编码器。具体而言,我们通过最小化干净视觉特征与扰动视觉特征之间的余弦相似度来生成对抗样本,无需访问后续的大语言模型、任务信息和标签。这显著降低了计算开销,同时消除了LVLMs中传统白盒攻击的任务和标签依赖性。为了使这一简单攻击有效,我们提出通过优化图像令牌而非分类令牌来扰动图像。我们提供了实证和理论证据,证明VEAttack可以轻松泛化到各种任务。VEAttack在图像描述任务上实现了94.5%的性能退化,在视觉问答任务上实现了75.7%的性能退化。我们还揭示了一些关键观察结果,以提供对LVLM攻击/防御的洞察:1)LLM隐藏层变化,2)令牌注意力差异,3)迁移攻击中的莫比乌斯带,4)对攻击步数的低敏感性。代码可在 https://github.com/hefeimei06/VEAttack-LVLM 获取。

关键词

引用

@article{arxiv.2505.17440,
  title  = {VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models},
  author = {Hefei Mei and Zirui Wang and Shen You and Minjing Dong and Chang Xu},
  journal= {arXiv preprint arXiv:2505.17440},
  year   = {2026}
}