中文

用投影梯度下降量化对抗训练中模型梯度的偏好方向

机器学习 2023-04-21 v5 计算机视觉与模式识别 机器学习

摘要

对抗训练,尤其是投影梯度下降(PGD),已被证明是提高对抗攻击鲁棒性的成功方法。对抗训练后,模型相对于其输入的梯度具有一个偏好方向。然而,该对齐方向在数学上尚未明确建立,难以定量评估。我们提出该方向的新定义:指向决策空间中最近的不准确类别的支撑集最近点的向量方向。为评估对抗训练后与该方向的对齐程度,我们应用一种利用生成对抗网络(GAN)产生改变图像中现有类别所需最小残差的度量。我们表明,根据我们的定义,PGD 训练的模型比基线具有更高的对齐度,我们的度量比一种竞争度量公式呈现更高的对齐值,且强制该对齐可提升模型的鲁棒性。

关键词

引用

@article{arxiv.2009.04709,
  title  = {Quantifying the Preferential Direction of the Model Gradient in Adversarial Training With Projected Gradient Descent},
  author = {Ricardo Bigolin Lanfredi and Joyce D. Schroeder and Tolga Tasdizen},
  journal= {arXiv preprint arXiv:2009.04709},
  year   = {2023}
}

备注

This paper was published in Pattern Recognition