AnyAttack: 大规模自监督针对视觉语言模型的对抗攻击
机器学习
2025-03-31 v3 人工智能
摘要
由于其多模态能力,视觉语言模型(VLM)在现实场景中找到了诸多有影响力的应用。然而,近期研究揭示了VLM对基于图像的对抗攻击的脆弱性。传统的有针对性对抗攻击需要特定的目标和标签,限制了其现实影响。我们提出AnyAttack,一种自监督框架,超越了常规攻击的限制,基于一种新颖的基础模型方法。通过在大型LAION-400M数据集上无标签预训练,AnyAttack实现了前所未有的灵活性——使任何图像都能被转换为针对不同VLM中任何所需输出的攻击向量。该方法从根本上改变了威胁格局,使对抗能力在规模上达到前所未有的可及性。我们在五个开源VLM(CLIP、BLIP、BLIP2、InstructBLIP和MiniGPT-4)上的广泛验证表明,AnyAttack在 diverse multimodal tasks 上都有效。最令人担忧的是,AnyAttack无缝迁移到商业系统,包括Google Gemini、Claude Sonnet、Microsoft Copilot和OpenAI GPT,揭示了需要立即关注的系统性漏洞。
关键词
引用
@article{arxiv.2410.05346,
title = {AnyAttack: Towards Large-scale Self-supervised Adversarial Attacks on Vision-language Models},
author = {Jiaming Zhang and Junhong Ye and Xingjun Ma and Yige Li and Yunfan Yang and Yunhao Chen and Jitao Sang and Dit-Yan Yeung},
journal= {arXiv preprint arXiv:2410.05346},
year = {2025}
}
备注
CVPR 2025