中文

净化对抗训练(AToP):同步提升鲁棒性与泛化能力

计算机视觉与模式识别 2024-08-26 v4 人工智能

摘要

深度神经网络已知易受精心设计的对抗攻击影响。基于对抗训练(AT)的最成功防御技术可以实现对特定攻击的最优鲁棒性,但无法很好地泛化到未见过的攻击。另一种基于对抗净化(AP)的有效防御技术可以增强泛化能力,但无法实现最优鲁棒性。同时,两种方法都有一个共同的局限性,即标准准确率下降。为了缓解这些问题,我们提出了一种新颖的流程来获取鲁棒的净化器模型,称为净化对抗训练(Adversarial Training on Purification, AToP),该流程包含两个组成部分:通过随机变换(RT)进行扰动破坏,以及通过对抗损失微调(FT)的净化器模型。RT对于避免对已知攻击的过度学习至关重要,从而实现对未见攻击的鲁棒泛化;而FT对于提升鲁棒性至关重要。为了以高效且可扩展的方式评估我们的方法,我们在CIFAR-10、CIFAR-100和ImageNette上进行了大量实验,证明我们的方法实现了最优鲁棒性,并展现出对未见攻击的泛化能力。

关键词

引用

@article{arxiv.2401.16352,
  title  = {Adversarial Training on Purification (AToP): Advancing Both Robustness and Generalization},
  author = {Guang Lin and Chao Li and Jianhai Zhang and Toshihisa Tanaka and Qibin Zhao},
  journal= {arXiv preprint arXiv:2401.16352},
  year   = {2024}
}