F$^2$AT:通过自然与扰动模式解耦的特征聚焦对抗训练
计算机视觉与模式识别
2023-10-24 v1
摘要
深度神经网络(DNNs)易受由精心设计的扰动构造的对抗样本攻击。这可能在自动驾驶汽车、监控安全和医疗诊断等关键应用上导致灾难性后果。目前,对抗训练是对抗对抗样本最有效的防御方法之一。然而,由于 DNNs 仍学习到虚假特征,传统对抗训练难以在干净准确率与鲁棒性之间取得良好权衡。其内在原因在于,当对抗噪声与干净样本无法解耦时,传统对抗训练难以从对抗样本中充分学习核心特征。本文中,我们通过位平面切片将对抗样本解耦为自然模式与扰动模式。我们假设高位平面分别表示自然模式,低位平面分别表示扰动模式。我们提出特征聚焦对抗训练(FAT),其与先前工作的不同之处在于,它强制模型聚焦于自然模式中的核心特征,并降低来自扰动模式的虚假特征的影响。实验结果表明,FAT 在干净准确率与对抗鲁棒性上均优于最先进的方法。
引用
@article{arxiv.2310.14561,
title = {F$^2$AT: Feature-Focusing Adversarial Training via Disentanglement of Natural and Perturbed Patterns},
author = {Yaguan Qian and Chenyu Zhao and Zhaoquan Gu and Bin Wang and Shouling Ji and Wei Wang and Boyang Zhou and Pan Zhou},
journal= {arXiv preprint arXiv:2310.14561},
year = {2023}
}