中文

一个代理模型欺骗所有:基于 CLIP 的通用、可迁移与定向对抗攻击

密码学与安全 2025-07-09 v2 机器学习

摘要

深度神经网络(DNNs)已取得广泛成功,但仍然容易受到对抗攻击。通常,此类攻击要么涉及对目标模型的频繁查询,要么依赖于与目标模型紧密镜像的代理模型——通常使用目标模型训练数据的子集进行训练——以通过可迁移性实现高攻击成功率。然而,在训练数据不可用且过多查询可能引发警报的现实场景中,构造对抗样本变得更具挑战性。在本文中,我们提出了 UnivIntruder,一种仅依赖单一公开可用 CLIP 模型和公开可用数据集的新型攻击框架。通过使用文本概念,UnivIntruder 生成通用、可迁移且定向的对抗扰动,误导 DNNs 将输入错误分类为由文本概念定义的攻击者指定类别。我们的大量实验表明,该方法在 ImageNet 上的攻击成功率(ASR)高达 85%,在 CIFAR-10 上超过 99%,显著优于现有的基于迁移的方法。此外,我们揭示了现实世界中的漏洞,表明即使不查询目标模型,UnivIntruder 也能以高达 84% 的 ASR 攻陷 Google 和 Baidu 等图像搜索引擎,并以高达 80% 的 ASR 攻陷 GPT-4 和 Claude-3.5 等视觉语言模型。这些发现凸显了我们的攻击在传统途径被阻断的场景中的实用性,强调了重新评估 AI 应用中安全范式的必要性。

关键词

引用

@article{arxiv.2505.19840,
  title  = {One Surrogate to Fool Them All: Universal, Transferable, and Targeted Adversarial Attacks with CLIP},
  author = {Binyan Xu and Xilin Dai and Di Tang and Kehuan Zhang},
  journal= {arXiv preprint arXiv:2505.19840},
  year   = {2025}
}

备注

21 pages, 15 figures, 18 tables. To appear in the Proceedings of The ACM Conference on Computer and Communications Security (CCS), 2025