中文

通过协同多模态交互提升视觉语言预训练模型对抗迁移性

计算机视觉与模式识别 2024-07-09 v2 密码学与安全 多媒体

摘要

尽管视觉语言预训练 (VLP) 模型在显著进步,但其对对抗攻击的脆弱性仍是重要挑战。现有工作很少研究 VLP 模型攻击的迁移性,这导致其性能与白盒攻击之间存在显著差距。我们注意到,先前的工作忽略了模态之间交互机制,这在理解 VLP 模型的细节方面发挥关键作用。为此,我们提出了一种新型攻击方法,称为协同多模态交互攻击 (CMI-Attack),通过嵌入引导和交互增强来利用模态交互。具体而言,攻击文本的嵌入层 while 保持语义一致,并利用交互图像梯度来增强对文本和图像扰动的约束。显著地,在 Flickr30K 数据集上的图像-文本检索任务中,CMI-Attack 将从 ALBEF 到 TCL、CLIPViT\text{CLIP}_{\text{ViT}}CLIPCNN\text{CLIP}_{\text{CNN}} 的转移成功率提高了 8.11% - 16.75%。此外,CMI-Attack 在跨任务泛化场景中也表现出优异性能。我们的工作涵盖了 VLP 模型转移攻击的未探索领域,为增强对抗鲁棒性指出了模态交互的重要性。

关键词

引用

@article{arxiv.2403.10883,
  title  = {Improving Adversarial Transferability of Vision-Language Pre-training Models through Collaborative Multimodal Interaction},
  author = {Jiyuan Fu and Zhaoyu Chen and Kaixun Jiang and Haijing Guo and Jiafeng Wang and Shuyong Gao and Wenqiang Zhang},
  journal= {arXiv preprint arXiv:2403.10883},
  year   = {2024}
}

备注

This work won first place in CVPR 2024 Workshop Challenge: Black-box Adversarial Attacks on Vision Foundation Models