中文

何时何地攻击?面向大视觉-语言模型的阶段性注意力引导对抗攻击

计算机视觉与模式识别 2026-02-05 v1

摘要

针对大型视觉-语言模型(LVLMs)的对抗攻击对于暴露现代多模态系统的安全漏洞至关重要。最近的攻击基于输入转换(如随机裁剪),表明空间局部扰动比全局图像操作更有效。然而,随机裁剪整个图像是本质上随机的,未能有效利用有限的像素级扰动预算。我们提出两个关键观察:(i)区域注意力得分与对抗损失敏感性呈正相关,(ii)攻击高注意力区域会导致注意力向后续显著区域的结构性重新分配。基于上述发现,我们提出了阶段性注意力引导攻击(SAGA),一种注意力引导框架,逐步将扰动集中在高注意力区域。SAGA能够更有效地利用受限扰动预算,生成高度隐形的对抗样本,同时在十个LVLMs上持续实现最先进的攻击成功率。源代码可在https://github.com/jackwaky/SAGA获取。

关键词

引用

@article{arxiv.2602.04356,
  title  = {When and Where to Attack? Stage-wise Attention-Guided Adversarial Attack on Large Vision Language Models},
  author = {Jaehyun Kwak and Nam Cao and Boryeong Cho and Segyu Lee and Sumyeong Ahn and Se-Young Yun},
  journal= {arXiv preprint arXiv:2602.04356},
  year   = {2026}
}

备注

Pre-print