何时何地攻击?面向大视觉-语言模型的阶段性注意力引导对抗攻击
计算机视觉与模式识别
2026-02-05 v1
摘要
针对大型视觉-语言模型(LVLMs)的对抗攻击对于暴露现代多模态系统的安全漏洞至关重要。最近的攻击基于输入转换(如随机裁剪),表明空间局部扰动比全局图像操作更有效。然而,随机裁剪整个图像是本质上随机的,未能有效利用有限的像素级扰动预算。我们提出两个关键观察:(i)区域注意力得分与对抗损失敏感性呈正相关,(ii)攻击高注意力区域会导致注意力向后续显著区域的结构性重新分配。基于上述发现,我们提出了阶段性注意力引导攻击(SAGA),一种注意力引导框架,逐步将扰动集中在高注意力区域。SAGA能够更有效地利用受限扰动预算,生成高度隐形的对抗样本,同时在十个LVLMs上持续实现最先进的攻击成功率。源代码可在https://github.com/jackwaky/SAGA获取。
引用
@article{arxiv.2602.04356,
title = {When and Where to Attack? Stage-wise Attention-Guided Adversarial Attack on Large Vision Language Models},
author = {Jaehyun Kwak and Nam Cao and Boryeong Cho and Segyu Lee and Sumyeong Ahn and Se-Young Yun},
journal= {arXiv preprint arXiv:2602.04356},
year = {2026}
}
备注
Pre-print