理解并提高 Frank-Wolfe 对抗训练的效率
机器学习
2022-03-28 v5 计算机视觉与模式识别
摘要
深度神经网络易被称为对抗攻击的小扰动欺骗。对抗训练(AT)是一种近似求解鲁棒优化问题以最小化最坏情况损失的技术,被广泛视为最有效的防御手段。由于在 AT 过程中生成强对抗样本的计算时间较高,已提出单步方法以减少训练时间。然而,这些方法遭受灾难性过拟合,即对抗准确率在训练中下降,并且尽管已有改进提议,它们增加了训练时间且鲁棒性远不及多步 AT。我们为基于 FW 优化的对抗训练(FW-AT)建立了理论框架,揭示了损失景观与 FW 攻击的 失真之间的几何联系。我们分析表明,FW 攻击的高失真等价于沿攻击路径的梯度变化小。随后在各种深度神经网络架构上实验证明,针对鲁棒模型的 攻击实现了接近最大的失真,而标准网络失真较低。实验表明灾难性过拟合与 FW 攻击的低失真强相关。这种数学透明性使 FW 区别于投影梯度下降(PGD)优化。为展示我们理论框架的效用,我们开发了 FW-AT-Adapt,一种新颖的对抗训练算法,其使用简单的失真度量在训练中自适应攻击步数,以在不损害鲁棒性的前提下提高效率。FW-AT-Adapt 的训练时间与单步快速 AT 方法相当,并在白盒与黑盒设定下以最小的对抗准确率损失弥合了快速 AT 方法与多步 PGD-AT 之间的差距。
引用
@article{arxiv.2012.12368,
title = {Understanding and Increasing Efficiency of Frank-Wolfe Adversarial Training},
author = {Theodoros Tsiligkaridis and Jay Roberts},
journal= {arXiv preprint arXiv:2012.12368},
year = {2022}
}
备注
IEEE/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2022. Preliminary version ICML 2021 Adversarial Machine Learning Workshop. Code: https://github.com/TheoT1/FW-AT-Adapt