语言引导的对抗净化
机器学习
2026-04-10 v1 密码学与安全
计算机视觉与模式识别
摘要
使用生成模型的对抗净化展现出强大的对抗防御性能。这些方法与分类器和攻击无关,使其通用但往往计算密集。扩散与分数网络的最新进展改进了图像生成,并由此改进了对抗净化。另一类被称为对抗训练的高效对抗防御方法需要攻击向量的特定知识,迫使它们在对抗样本上广泛训练。为克服这些局限,我们引入了一个新框架,即语言引导的对抗净化(LGAP),利用预训练扩散模型与字幕生成器防御对抗攻击。给定输入图像,我们的方法首先生成字幕,随后通过扩散网络引导对抗净化过程。我们的方法已在强对抗攻击下评估,证明了其在增强对抗鲁棒性方面的有效性。结果表明,LGAP 优于大多数现有对抗防御技术,且无需专门的网络训练。这凸显了在大型数据集上训练模型的泛化能力,指明了值得进一步研究的有前景方向。
引用
@article{arxiv.2309.10348,
title = {Language Guided Adversarial Purification},
author = {Himanshu Singh and A V Subramanyam},
journal= {arXiv preprint arXiv:2309.10348},
year = {2026}
}