一种基于对比语言-图像预训练模型引导的生成式对抗攻击方法
计算机视觉与模式识别
2025-11-18 v2
摘要
深度学习的快速增长带来了能够处理各种任务的强大模型,如识别图像和理解语言。然而,adversarial attacks 是一种潜在的未被察觉的变更,可欺骗模型,导致不准确的预测。本文提出一种生成式对抗攻击方法,使用 CLIP 模型创建高效且视觉上难以察觉的对抗扰动。CLIP 模型的能力在将文本和图像表示对齐方面,帮助将自然语言语义与引导损失集成,以生成有效且看似与原始输入相同identical 的对抗示例。这一集成允许在多对象环境中进行 extensive 场景操控,创建针对 multilabel 分类器特别设计的扰动。我们的 methods 将来自基于灵敏度的自动编码器 (SSAE) 的集中扰动策略与类似生成式对抗多对象场景攻击 (GAMA) 的异质文本嵌入相结合,产生既能欺骗分类模型又能保持与原始图像高度结构相似性的扰动。该 model 在各种任务上测试于 diverse black-box victim models 上。实验结果表明,我们的方法在竞争中表现出色,实现了与现有技术相当或更好的成绩,同时保持更高的视觉保真度。
引用
@article{arxiv.2511.01317,
title = {A Generative Adversarial Approach to Adversarial Attacks Guided by Contrastive Language-Image Pre-trained Model},
author = {Sampriti Soor and Alik Pramanick and Jothiprakash K and Arijit Sur},
journal= {arXiv preprint arXiv:2511.01317},
year = {2025}
}
备注
18 pages, 3 figures