中文

链式攻击:面向迁移式对抗攻击的视觉语言模型鲁健性研究

计算机视觉与模式识别 2024-11-26 v1

摘要

预训练视觉语言模型(vision-language models, VLMs)在图像和自然语言理解方面展现出卓越性能,如图像描述生成和响应生成。随着视觉语言模型的实际应用日益广泛,其潜在的安全性和鲁健性问题引发广泛关注,恶意攻击者可能通过攻击规避系统,导致模型生成有害内容。因此,评估开源视觉语言模型针对对抗攻击的鲁健性受到越来越多关注,其中迁移式攻击作为典型的黑盒攻击策略受到关注。然而,现有大多数迁移式攻击忽视了视觉与文本模态之间语义关联的重要性,导致对抗样本生成和攻击性能不佳。为此,我们提出链式攻击(Chain of Attack, CoA),基于多模态语义更新的一系列中间攻击步骤,迭代增强对抗样本的生成,实现更高的对抗迁移性和效率。进一步提出了统一的攻击成功率计算方法,用于自动化规避评估。在最真实和高风险情景下的大量实验表明,我们的攻击策略仅通过黑盒攻击即可有效误导模型生成目标响应,且无需了解受害模型的任何信息。本文提供的全面鲁健性评估为理解视觉语言模型的脆弱性,并为未来模型开发的安全性考量提供参考。

关键词

引用

@article{arxiv.2411.15720,
  title  = {Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks},
  author = {Peng Xie and Yequan Bie and Jianda Mao and Yangqiu Song and Yang Wang and Hao Chen and Kani Chen},
  journal= {arXiv preprint arXiv:2411.15720},
  year   = {2024}
}