基于分布迁移的对抗防御
密码学与安全
2023-11-27 v1
摘要
对抗样本的存在对深度学习模型及其应用构成重大威胁。现有防御方法对对抗样本提供了一定韧性,但常面临准确率和泛化性能下降的问题,难以在鲁棒性与泛化之间取得权衡。为此,本文从样本分布视角解读对抗样本问题,并提出一种基于分布偏移的防御方法,利用扩散模型的分布迁移能力进行对抗防御。其核心思想是借助正常样本与对抗样本分布之间的差异,使用预训练扩散模型实现对抗防御。具体而言,对抗样本经历前向扩散过程远离源分布,随后由受保护模型(受害模型)输出引导的反向过程将其映射回正常分布。我们在 CIFAR10 和 ImageNet30 数据集上进行了实验评估,与对抗训练及输入预处理方法比较。对于扰动为 8/255 的无穷范数攻击,准确率分别达到 78.1% 和 83.5%;对于扰动为 128/255 的 2-范数攻击,准确率分别为 74.3% 和 82.5%。考虑扰动幅度、扩散迭代次数和自适应攻击的附加实验也验证了所提方法的有效性。结果表明,即便攻击者知晓防御,该基于分布的方法仍能有效抵御对抗样本。它弥补了传统方法的不足,恢复高质量原始样本,并在模型鲁棒性与泛化上展现出优越性能。
引用
@article{arxiv.2311.13841,
title = {Adversarial defense based on distribution transfer},
author = {Jiahao Chen and Diqun Yan and Li Dong},
journal= {arXiv preprint arXiv:2311.13841},
year = {2023}
}
备注
27 pages