误导扩散:生成对抗样本
机器学习
2024-07-01 v1 人工智能
摘要
我们提出了误导扩散的概念——训练生成式 AI 模型以产生对抗图像。传统对抗攻击算法旨在扰动现有图像以引发误分类,而误导扩散模型可创建任意数量的新型误分类图像,这些图像与训练或测试图像无直接关联。误导扩散可通过提供大规模对抗训练数据来强化防御算法,包括其他难以发现的误分类类型。在我们的实验中,我们还研究了在部分受攻击数据集上训练的效果。这凸显了生成式扩散模型的一种新型漏洞:如果攻击者能够隐蔽地中毒一部分训练数据,则生成的扩散模型将产生类似比例的误导输出。
引用
@article{arxiv.2406.19807,
title = {Deceptive Diffusion: Generating Synthetic Adversarial Examples},
author = {Lucas Beerens and Catherine F. Higham and Desmond J. Higham},
journal= {arXiv preprint arXiv:2406.19807},
year = {2024}
}