基于潜表示约束的对抗微调以缓解准确率-鲁棒性权衡
计算机视觉与模式识别
2023-09-01 v1 机器学习
摘要
本文研究深度神经网络(DNN)在干净样本上的标准准确率与对抗样本鲁棒性之间的权衡。尽管对抗训练(AT)提升了鲁棒性,却降低了标准准确率,从而产生该权衡。为缓解此权衡,我们提出一种称为ARREST的新颖AT方法,其包含三个组件:(i) 对抗微调(AFT),(ii) 表示引导的知识蒸馏(RGKD),以及 (iii) 噪声重放(NR)。AFT通过在干净样本上标准预训练的DNN初始化参数,在对抗样本上训练DNN。RGKD与NR分别包含一个正则化项与一种算法,以在AFT期间保留干净样本的潜表示。RGKD惩罚标准预训练DNN与AFT DNN的表示之间的距离。NR在AFT期间表示发生显著变化时将输入对抗样本切换为非对抗样本。通过组合这些组件,ARREST同时实现了高标准准确率与鲁棒性。实验结果表明,ARREST比以往基于AT的方法更有效地缓解了该权衡。
引用
@article{arxiv.2308.16454,
title = {Adversarial Finetuning with Latent Representation Constraint to Mitigate Accuracy-Robustness Tradeoff},
author = {Satoshi Suzuki and Shin'ya Yamaguchi and Shoichiro Takeda and Sekitoshi Kanai and Naoki Makishima and Atsushi Ando and Ryo Masumura},
journal= {arXiv preprint arXiv:2308.16454},
year = {2023}
}
备注
Accepted by International Conference on Computer Vision (ICCV) 2023