随机安全性:基于能量模型长程动力学的对抗防御
机器学习
2021-03-22 v2 密码学与安全
机器学习
摘要
深度网络对对抗攻击的脆弱性,是从认知与安全角度看深度学习的核心问题。当前最成功的防御方法是在学习中用生成的对抗图像训练分类器。另一防御思路是在分类前对原始输入进行变换或净化以去除对抗信号。我们聚焦于使用基于能量模型 (EBM) 的马尔可夫链蒙特卡洛 (MCMC) 采样,为自然训练分类器进行对抗净化防御。与对抗训练不同,我们的方法旨在保护已有且高度脆弱的分类器。长程 MCMC 采样的无记忆行为终将去除对抗信号,而亚稳态行为在许多步后保持 MCMC 样本外观一致,以实现准确的长程预测。平衡这些因素可达成有效净化与鲁棒分类。我们使用针对净化的最强已知攻击评估基于 EBM 的对抗防御。我们的贡献为:1) 一种用真实长程 MCMC 样本训练 EBM 的改进方法;2) 一种解决随机防御理论模糊性的变换期望 (EOT) 防御,并由此自然导出 EOT 攻击;3) 对自然训练分类器的顶尖对抗防御,且在 Cifar-10、SVHN 与 Cifar-100 上相较对抗训练分类器具竞争力。代码与预训练模型见 https://github.com/point0bar1/ebm-defense。
引用
@article{arxiv.2005.13525,
title = {Stochastic Security: Adversarial Defense Using Long-Run Dynamics of Energy-Based Models},
author = {Mitch Hill and Jonathan Mitchell and Song-Chun Zhu},
journal= {arXiv preprint arXiv:2005.13525},
year = {2021}
}
备注
ICLR 2021