中文

基于单向量的视觉语言模型高效对抗检测方法

计算机视觉与模式识别 2024-10-31 v1 计算与语言 密码学与安全

摘要

视觉语言模型(VLMs)容易受到对抗样本攻击,尤其是来自对抗图像的攻击,但这一问题在文献中尚未得到充分探索。为促进这一关键安全问题的研究,我们首先构建了一个新的大规模对抗图像数据集——具有多样化有害响应的对抗图像数据集(RADAR),因为现有数据集要么规模较小,要么仅包含有限类型的有害响应。基于新的RADAR数据集,我们进一步提出了一种新颖且有效的基于嵌入的对抗图像实时检测方法(NEARSIDE),该方法利用从VLMs隐藏状态中提取的单个向量——我们称之为攻击方向——来实现对输入中对抗图像与良性图像的区分。通过在两个受害VLMs(LLaVA和MiniGPT-4)上的大量实验,充分验证了所提方法的有效性、高效性和跨模型可迁移性。我们的代码可在 https://github.com/mob-scu/RADAR-NEARSIDE 获取。

关键词

引用

@article{arxiv.2410.22888,
  title  = {Effective and Efficient Adversarial Detection for Vision-Language Models via A Single Vector},
  author = {Youcheng Huang and Fengbin Zhu and Jingkun Tang and Pan Zhou and Wenqiang Lei and Jiancheng Lv and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2410.22888},
  year   = {2024}
}