面向多模态 LLM 攻击的对抗引导扩散
计算机视觉与模式识别
2025-08-01 v1
摘要
本文解决了使用扩散模型生成对抗图像以欺骗多模态大语言模型(MLLM)生成目标响应的挑战,同时避免对干净图像的显著失真。为应对上述挑战,我们提出了一种用于对抗攻击 MLLM 的对抗引导扩散(AGD)方法。我们引入对抗引导噪声以确保攻击有效性。我们设计中的一个关键观察是,与大多数将高频扰动直接嵌入干净图像的传统对抗攻击不同,AGD 将目标语义注入到反向扩散的噪声分量中。由于扩散模型中添加的噪声跨越整个频谱,嵌入其中的对抗信号也继承了这种全频谱特性。重要的是,在反向扩散过程中,对抗图像是干净图像和噪声的线性组合。因此,当应用诸如简单低通滤波等独立作用于各分量的防御手段时,噪声分量中的对抗图像不太可能被抑制,因为它不局限于高频段。这使得 AGD 本质上对各种防御具有鲁棒性。大量实验表明,我们的 AGD 在攻击性能以及对某些防御的模型鲁棒性方面均优于 SOTA 方法。
引用
@article{arxiv.2507.23202,
title = {Adversarial-Guided Diffusion for Multimodal LLM Attacks},
author = {Chengwei Xia and Fan Ma and Ruijie Quan and Kun Zhan and Yi Yang},
journal= {arXiv preprint arXiv:2507.23202},
year = {2025}
}