基于离散化的安全机器学习对抗 adversarial 攻击防御方案
机器学习
2019-06-04 v2 密码学与安全
计算机视觉与模式识别
机器学习
摘要
对抗样本是(根据深度学习的网络(DLN)参数梯度)精心构造的扰动输入,旨在测试阶段误导 DLN。直观上,约束网络输入或参数的维数可减少对抗样本存在的“空间”。受此直觉引导,我们证明离散化极大提升了 DLN 对抗对抗攻击的鲁棒性。具体而言,离散化输入空间(或将允许的像素电平从 256 值即 8-bit 降至 4 值即 2-bit)在测试精度损失极小的情况下,于较大扰动范围内显著改善了 DLN 的对抗鲁棒性。此外,我们发现二值神经网络(BNN)及其相关变体在对抗场景下本质上的鲁棒性优于其全精度对应物。将输入离散化与 BNN 结合进一步增强了鲁棒性,甚至在某种扰动幅度下免除了对抗训练的需要。我们在 MNIST、CIFAR10、CIFAR100 和 Imagenet 数据集上评估了离散化的效果。在所有数据集中,我们观察到 2-bit 输入离散化具有最大对抗抗性,其对抗精度损失相较干净测试精度仅约 1-2%。
引用
@article{arxiv.1902.03151,
title = {Discretization based Solutions for Secure Machine Learning against Adversarial Attacks},
author = {Priyadarshini Panda and Indranil Chakraborty and Kaushik Roy},
journal= {arXiv preprint arXiv:1902.03151},
year = {2019}
}
备注
8 pages, 8 Figures, 6 Tables