中文

Blacksmith:通过单步与多步方法混合对视觉 Transformer 进行快速对抗训练

计算机视觉与模式识别 2023-10-31 v1 机器学习

摘要

尽管深度学习算法在计算机视觉等诸多领域取得了显著成功,它们仍易受对抗扰动的影响。对抗训练(AT)是解决该问题最有效方法之一;然而,单步 AT 可能导致灾难性过拟合(CO)。该情形发生于对抗训练后的网络突然丧失对多步攻击(如投影梯度下降(PGD))的鲁棒性。尽管已有若干方法在卷积神经网络(CNN)中解决此问题,我们发现它们应用于视觉 Transformer(ViT)时表现不佳。本文提出 Blacksmith,一种专为克服 ViT 中 CO 问题而设计的新型训练策略。我们的方法在神经网络的对抗训练过程中,于小批量内随机选用 PGD-2 或快速梯度符号法(FGSM)之一。这增加了训练攻击的多样性,有望缓解 CO 问题。为应对该组合带来的训练时间增加,我们仅基于前一半层构造 PGD-2 攻击,而 FGSM 端到端应用。实验表明,该新方法有效防止 CO,达到 PGD-2 级别性能,并优于包括 N-FGSM(CNN 快速训练中的 SOTA 方法)在内的其他现有技术。

关键词

引用

@article{arxiv.2310.18975,
  title  = {Blacksmith: Fast Adversarial Training of Vision Transformers via a Mixture of Single-step and Multi-step Methods},
  author = {Mahdi Salmani and Alireza Dehghanpour Farashah and Mohammad Azizmalayeri and Mahdi Amiri and Navid Eslami and Mohammad Taghi Manzuri and Mohammad Hossein Rohban},
  journal= {arXiv preprint arXiv:2310.18975},
  year   = {2023}
}