重新思考 PGD 攻击:符号函数是必要的吗?
机器学习
2024-05-22 v2 密码学与安全
机器学习
摘要
神经网络在各个领域展现了成功,但即使是很小的输入扰动也会显著降低其性能。因此,这种被称为对抗攻击的扰动构造引起了广泛关注,其中许多属于我们拥有对神经网络完全访问权限的“白盒”场景。现有攻击算法,如投影梯度下降(PGD),通常在更新对抗输入之前对原始梯度取符号函数,从而忽略了梯度幅度信息。在本文中,我们对这种基于符号的更新算法如何影响逐步攻击性能进行了理论分析,并指出了其注意事项。我们还解释了为什么以往直接使用原始梯度的尝试会失败。基于此,我们进一步提出了一种新的原始梯度下降(RGD)算法,消除了符号的使用。具体而言,我们通过引入一个新的非裁剪扰动的隐变量,使其可以超越约束,从而将约束优化问题转化为无约束优化问题。实验广泛证明了所提出的 RGD 算法的有效性,在各种设置下均优于 PGD 和其他竞争方法,且不产生任何额外的计算开销。代码可在 https://github.com/JunjieYang97/RGD 获取。
引用
@article{arxiv.2312.01260,
title = {Rethinking PGD Attack: Is Sign Function Necessary?},
author = {Junjie Yang and Tianlong Chen and Xuxi Chen and Zhangyang Wang and Yingbin Liang},
journal= {arXiv preprint arXiv:2312.01260},
year = {2024}
}