双通用对抗性扰动:单一扰动跨越图像和文本欺骗视觉语言模型
计算机视觉与模式识别
2024-12-20 v2 计算与语言
密码学与安全
摘要
大型视觉语言模型 (VLM) 通过整合视觉编码器与大语言模型 (LLM) 在多模态任务上展示了显著的性能。然而,这些模型仍然容易受到对抗攻击。其中,通用对抗性扰动 (UAP) 尤为强大,因为单个优化扰动即可在各种输入图像上误导模型。本文引入一种专为 VLM 设计的新型 UAP:双通用对抗性扰动 (Doubly-UAP),其能够在图像和文本输入上普遍欺骗 VLM。为成功扰乱视觉编码器的基本过程,我们分析注意力机制的核心组件。经过识别中间到后期层中的值向量最为脆弱,我们以标签无关方式对 Doubly-UAP 进行优化。尽管作为 LLM 的黑盒子进行开发,Doubly-UAP 在 VLM 上仍实现了高成功率,始终优于基线方法。广泛的消融研究和分析进一步证明了 Doubly-UAP 的鲁棒性,并提供了关于其如何影响内部注意力机制的见解。
关键词
引用
@article{arxiv.2412.08108,
title = {Doubly-Universal Adversarial Perturbations: Deceiving Vision-Language Models Across Both Images and Text with a Single Perturbation},
author = {Hee-Seon Kim and Minbeom Kim and Changick Kim},
journal= {arXiv preprint arXiv:2412.08108},
year = {2024}
}