中文

重新审视视觉语言模型的对抗鲁棒性:多模态视角

计算机视觉与模式识别 2024-11-13 v3

摘要

预训练的视觉语言模型(如CLIP)在多样化的下游任务中展现出卓越的泛化能力。尽管最近的研究揭示了它们对对抗攻击的脆弱性,但迄今为止的研究主要集中在增强图像编码器对基于图像的攻击的鲁棒性,而对基于文本和多模态攻击的防御仍基本未被探索。为此,本文首次全面研究了如何提高VLM对针对图像、文本和多模态输入的攻击的对抗鲁棒性。这是通过提出多模态对比对抗训练来实现的。这种方法通过将干净文本嵌入与对抗图像嵌入对齐,以及将对抗文本嵌入与干净图像嵌入对齐,来增强图像和文本编码器的鲁棒性。在CLIP模型上,针对图像、文本和多模态攻击,将所提出的MMCoA的鲁棒性与现有防御方法进行了比较。在两个任务的15个数据集上进行的大量实验揭示了不同对抗防御方法在三种攻击类型下,在不同分布偏移和数据集复杂度下的特性。这为针对不同模态攻击的对抗鲁棒性统一框架铺平了道路,为保护VLM免受多模态攻击开辟了新的可能性。代码可在https://github.com/ElleZWQ/MMCoA.git获取。

关键词

引用

@article{arxiv.2404.19287,
  title  = {Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective},
  author = {Wanqi Zhou and Shuanghao Bai and Danilo P. Mandic and Qibin Zhao and Badong Chen},
  journal= {arXiv preprint arXiv:2404.19287},
  year   = {2024}
}

备注

17 pages, 13 figures