利用一阶扰动改进基于变换的对抗样本防御
计算机视觉与模式识别
2024-01-30 v3 机器学习
摘要
深度神经网络已成功应用于各种机器学习任务。然而,研究表明神经网络易受对抗攻击,这暴露了基于神经网络的智能系统的潜在威胁。我们观察到,通过对对抗样本施加为未预测类别标签生成的小的一阶扰动,神经网络输出正确结果的概率有所提高。基于该观察,我们提出了一种抵消对抗扰动以提升对抗鲁棒性的方法。在所提方法中,我们随机选取若干类别标签并为这些选定标签生成小的一阶扰动。生成的扰动被叠加在一起,然后被钳制到指定空间。所得扰动最终被加到对抗样本上,以抵消样本中含有的对抗扰动。所提方法在推理时应用,无需重新训练或微调模型。我们在 CIFAR-10 和 CIFAR-100 上对所提方法进行了实验验证。结果表明,我们的方法有效提升了若干基于变换的防御方法的防御性能,尤其是针对使用更多迭代生成的强对抗样本。
引用
@article{arxiv.2103.04565,
title = {Improving Transformation-based Defenses against Adversarial Examples with First-order Perturbations},
author = {Haimin Zhang and Min Xu},
journal= {arXiv preprint arXiv:2103.04565},
year = {2024}
}
备注
This paper has technical errors