面向视觉-语言预训练模型的对抗攻击研究
机器学习
2022-10-21 v2 计算与语言
计算机视觉与模式识别
多媒体
摘要
尽管视觉-语言预训练模型(VLP)在各种视觉-语言(V+L)任务上已展现出革命性的提升,但关于其对抗鲁棒性的研究在很大程度上仍处于空白。本文研究了针对流行 VLP 模型和 V+L 任务的对抗攻击。首先,我们分析了不同设置下对抗攻击的性能。通过考察不同扰动对象和攻击目标的影响,我们总结出若干关键观察,为设计强大多模态对抗攻击和构建鲁棒 VLP 模型提供指导。其次,我们提出了一种针对 VLP 模型的新型多模态攻击方法,称为协同多模态对抗攻击(Co-Attack),该方法联合对图像模态和文本模态实施攻击。实验结果表明,所提方法在不同的 V+L 下游任务和 VLP 模型上均取得了更优的攻击性能。这些分析观察和新型攻击方法有望为 VLP 模型的对抗鲁棒性提供新的理解,从而助力其在更多现实场景中的安全可靠部署。代码见 https://github.com/adversarial-for-goodness/Co-Attack。
引用
@article{arxiv.2206.09391,
title = {Towards Adversarial Attack on Vision-Language Pre-training Models},
author = {Jiaming Zhang and Qi Yi and Jitao Sang},
journal= {arXiv preprint arXiv:2206.09391},
year = {2022}
}
备注
Accepted by ACM MM2022. Code is available in GitHub