中文

自然语言诱导的对抗图像

密码学与安全 2024-10-14 v1 计算机视觉与模式识别 多媒体

摘要

对抗攻击研究对于AI安全至关重要,因为它揭示了深度学习模型的脆弱性,并有助于构建更鲁棒的模型。针对图像的对抗攻击研究最为广泛,包括基于噪声的攻击、基于图像编辑的攻击和基于潜在空间的攻击。然而,这些方法生成的对抗图像往往缺乏足够的语义信息,使得在自然条件下理解深度学习模型的失效模式变得困难。为了解决这个问题,我们提出了一种自然语言诱导的对抗图像攻击方法。其核心思想是利用文本到图像模型,根据输入提示词生成对抗图像,这些提示词被恶意构造以导致目标模型错误分类。为了利用商业文本到图像模型生成更自然的对抗图像,我们提出了一种自适应遗传算法(GA)来优化离散的对抗提示词,无需梯度,并提出了一种自适应词空间缩减方法以提高查询效率。我们进一步使用CLIP来保持生成图像的语义一致性。在实验中,我们发现一些高频语义信息(如“雾蒙蒙”、“潮湿”、“拉伸”等)容易导致分类器出错。这些对抗性语义信息不仅存在于生成的图像中,也存在于真实世界拍摄的照片中。此外,我们发现一些对抗性语义信息可以迁移到未知的分类任务。更进一步,我们的攻击方法可以迁移到不同的文本到图像模型(如Midjourney、DALL-E 3等)和图像分类器。代码可在https://github.com/zxp555/Natural-Language-Induced-Adversarial-Images获取。

关键词

引用

@article{arxiv.2410.08620,
  title  = {Natural Language Induced Adversarial Images},
  author = {Xiaopei Zhu and Peiyang Xu and Guanning Zeng and Yingpeng Dong and Xiaolin Hu},
  journal= {arXiv preprint arXiv:2410.08620},
  year   = {2024}
}

备注

Carmera-ready version. To appear in ACM MM 2024