中文

通过代理模型引导:迈向一种通用诊断性攻击

机器学习 2023-01-02 v1 人工智能 密码学与安全 计算机视觉与模式识别

摘要

对抗训练是一种使深度神经网络对对抗攻击具有鲁棒性的有效方法。近来,提出了不同的对抗训练防御方法,它们不仅保持较高的干净准确率,而且针对 PGD 等流行且被广泛研究的对抗攻击表现出显著的鲁棒性。如果攻击未能找到对抗梯度方向,也会出现高对抗鲁棒性,这种现象被称为“梯度掩蔽”。在这项工作中,我们分析了标签平滑对对抗训练的影响,将其作为梯度掩蔽的潜在原因之一。随后,我们开发了一种引导机制,以在攻击优化过程中避免局部极小值,从而提出了一种称为引导投影梯度攻击(G-PGA)的新攻击。我们的攻击方法基于“匹配与欺骗”损失,通过来自代理模型的引导寻找最优对抗方向。我们改进的攻击不需要随机重启、大量攻击迭代或寻找最优步长。此外,我们提出的 G-PGA 是通用的,因此它可以与集成攻击策略结合,正如我们在 Auto-Attack 案例中所展示的,从而提升了效率与收敛速度。G-PGA 不仅是一种有效的攻击,还可作为一种诊断工具,揭示对抗防御中由于梯度掩蔽而产生的隐蔽鲁棒性。

关键词

引用

@article{arxiv.2212.14875,
  title  = {Guidance Through Surrogate: Towards a Generic Diagnostic Attack},
  author = {Muzammal Naseer and Salman Khan and Fatih Porikli and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2212.14875},
  year   = {2023}
}

备注

IEEE Transactions on Neural Networks and Learning Systems (TNNLS)