注意力劫持:面向视觉语言模型的跨查询响应操控
计算机视觉与模式识别
2026-05-19 v1 人工智能
摘要
现有视觉语言模型(VLM)对抗攻击可将模型输出引导至攻击者指定的目标响应,但其有效性常在同一扰动输入搭配不同文本查询时会下降。本文研究跨查询响应操控,即单一对抗样本需在多样化用户查询下保持有效性。我们首先分析现有攻击的局限性,发现成功的迁移与在响应生成期间保持图像主导注意力模式密切相关。基于此观察,我们提出“注意力劫持”(Attention Hijacking),一种新型对抗攻击,显式地将内部注意力分布引导至持久的图像主导模式。通过放大视觉标记对目标响应标记的影响,同时抑制文本标记的竞争性影响,此方法减少了受特定查询词措辞影响的操控输出的依赖性。广泛实验表明,注意力劫持在多样化目标响应和未见查询下显著提升了跨查询迁移性。该方法还有效扩展到多种攻击场景,为视觉语言模型的可转移响应操控提供了新见解。
引用
@article{arxiv.2605.17310,
title = {Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models},
author = {Zhiqiang Wang and Dongrui Liu and Yan Li and Zonghao Ying and Wei Xue and Wenhan Luo and Yike Guo},
journal= {arXiv preprint arXiv:2605.17310},
year = {2026}
}