魔鬼在GAN中:深度生成模型的后门攻击与防御
密码学与安全
2022-12-15 v2 人工智能
机器学习
摘要
深度生成模型(DGM)是一类流行的深度学习模型,因其能够从复杂高维流形中合成数据而得到广泛应用。然而,尽管其工业应用日益增多,但尚未经过严格的安全与隐私分析。本文研究了其中一个方面,即针对DGM的后门攻击,这类攻击可能严重限制预训练模型在模型供应链中的适用性,并至少给从第三方外包DGM的公司带来巨大的声誉损失。虽然类似攻击场景已在经典预测模型中得到研究,但其在DGM中的表现尚未受到同等关注。为此,我们提出了新颖的训练时攻击,导致被破坏的DGM在正常操作下合成常规数据,而对于从触发分布中采样的输入则输出指定目标输出。这些攻击基于一种对抗损失函数,该函数结合了攻击隐蔽性和保真度的双重目标。我们系统分析了这些攻击,并展示了它们在多种方法(如生成对抗网络(GAN)和变分自编码器(VAE))以及不同数据领域(包括图像和音频)中的有效性。实验表明,即使对于大规模工业级DGM(如StyleGAN),我们的攻击也只需适度的计算量即可实施。我们还基于静态/动态模型和输出检查提出了合适的防御措施,展示了其有效性,并制定了一套实用且全面的防御策略,为DGM的安全使用铺平了道路。
引用
@article{arxiv.2108.01644,
title = {The Devil is in the GAN: Backdoor Attacks and Defenses in Deep Generative Models},
author = {Ambrish Rawat and Killian Levacher and Mathieu Sinn},
journal= {arXiv preprint arXiv:2108.01644},
year = {2022}
}
备注
17 pages, 11 figures, 3 tables