统一理解单模态模型与视觉语言预训练模型中的对抗性脆弱性
计算机视觉与模式识别
2024-07-26 v1 人工智能
摘要
尽管视觉语言预训练(VLP)模型在多模态交互能力方面表现出强大的性能,但神经网络的应用场景已不仅限于单模态领域,而是扩展到更复杂的多模态视觉+语言下游任务。单模态模型的安全漏洞已得到广泛考察,而VLP模型的漏洞则仍具挑战性。我们注意到,在计算机视觉模型中,图像理解来源于注释信息,而VLP模型则旨在直接从原始文本中学习图像表示。基于这一差异,我们开发了特征引导攻击(Feature Guidance Attack, FGA)方法,该方法利用文本表示来指导干净图像的扰动,从而生成对抗图像。FGA与单模态领域的许多先进攻击策略是正交的,这使得单模态领域丰富的研究发现能够直接应用于多模态场景。通过在FGA中引入文本攻击,我们构建了带文本攻击的特征引导(Feature Guidance with Text Attack, FGA-T)。通过双模态攻击的相互作用,FGA-T对VLP模型实现了卓越的攻击效果。此外,纳入数据增强和动量机制显著提高了FGA-T的黑盒迁移性。我们的方法在各种数据集、下游任务以及黑盒和白盒设置下,均表现出稳定且有效的攻击能力,为探索VLP模型鲁棒性提供了统一的基线。
引用
@article{arxiv.2407.17797,
title = {A Unified Understanding of Adversarial Vulnerability Regarding Unimodal Models and Vision-Language Pre-training Models},
author = {Haonan Zheng and Xinyang Deng and Wen Jiang and Wenrui Li},
journal= {arXiv preprint arXiv:2407.17797},
year = {2024}
}
备注
14 pages, 9 figures, published in ACMMM2024(oral)