一次扰动足矣:针对视觉语言预训练模型生成通用对抗扰动
计算机视觉与模式识别
2025-12-23 v4 密码学与安全
摘要
视觉语言预训练(VLP)模型通过充分利用多模态对齐,展现了在众多应用中的卓越能力。然而,先前研究表明,这些模型对恶意生成的对抗样本十分脆弱。尽管近期取得的进展令人鼓舞,但这些方法通常针对单个实例,需为每个输入样本生成扰动。本文揭示了 VLP 模型也可能受到实例非依赖性通用对抗扰动(UAP)的攻击。具体而言,我们设计了一种新型对比训练扰动生成器,集成跨模态条件(C-PGC)。鉴于高级对比学习技术实现了关键的多模态对齐,我们倾向于将这一强大的武器反向利用,即基于精心构建的正负图像-文本对,训练恶意版对比学习,以根本性地破坏 VLP 模型所学习的对齐关系。此外,C-PGC 充分利用视觉与语言(V+L)场景的特征,融合单模态和跨模态信息作为有效指导。广泛实验表明,C-PGC 成功地将对抗样本从 VLP 模型特征空间中的原始区域推远,从而本质上提升了针对各种受害模型和 V+L 任务的攻击效果。GitHub 仓库已公开 https://github.com/ffhibnese/CPGC_VLP_Universal_Attacks。
引用
@article{arxiv.2406.05491,
title = {One Perturbation is Enough: On Generating Universal Adversarial Perturbations against Vision-Language Pre-training Models},
author = {Hao Fang and Jiawei Kong and Wenbo Yu and Bin Chen and Jiawei Li and Hao Wu and Shutao Xia and Ke Xu},
journal= {arXiv preprint arXiv:2406.05491},
year = {2025}
}
备注
Accepted by ICCV-2025