中文

F$^2$AT:通过自然与扰动模式解耦的特征聚焦对抗训练

计算机视觉与模式识别 2023-10-24 v1

摘要

深度神经网络(DNNs)易受由精心设计的扰动构造的对抗样本攻击。这可能在自动驾驶汽车、监控安全和医疗诊断等关键应用上导致灾难性后果。目前,对抗训练是对抗对抗样本最有效的防御方法之一。然而,由于 DNNs 仍学习到虚假特征,传统对抗训练难以在干净准确率与鲁棒性之间取得良好权衡。其内在原因在于,当对抗噪声与干净样本无法解耦时,传统对抗训练难以从对抗样本中充分学习核心特征。本文中,我们通过位平面切片将对抗样本解耦为自然模式与扰动模式。我们假设高位平面分别表示自然模式,低位平面分别表示扰动模式。我们提出特征聚焦对抗训练(F2^2AT),其与先前工作的不同之处在于,它强制模型聚焦于自然模式中的核心特征,并降低来自扰动模式的虚假特征的影响。实验结果表明,F2^2AT 在干净准确率与对抗鲁棒性上均优于最先进的方法。

关键词

引用

@article{arxiv.2310.14561,
  title  = {F$^2$AT: Feature-Focusing Adversarial Training via Disentanglement of Natural and Perturbed Patterns},
  author = {Yaguan Qian and Chenyu Zhao and Zhaoquan Gu and Bin Wang and Shouling Ji and Wei Wang and Boyang Zhou and Pan Zhou},
  journal= {arXiv preprint arXiv:2310.14561},
  year   = {2023}
}