通过置信阈值缩减提升深度神经网络的鲁棒性与泛化能力
机器学习
2022-07-13 v2 计算机视觉与模式识别
摘要
深度神经网络易受难以察觉的扰动攻击。目前,对抗训练(AT)是增强模型抵御对抗样本鲁棒性的最有效方法。然而,由于对抗训练求解的是一个极小极大值问题,与自然训练相比,鲁棒性与泛化性相互矛盾,即模型鲁棒性的提升会降低其泛化性。为解决该问题,本文引入置信阈值(CT)这一新概念,并证明降低置信阈值(称为置信阈值缩减,CTR)可同时改善模型的泛化性与鲁棒性。具体而言,为在自然训练中降低CT(即采用CTR的自然训练),我们提出由交叉熵损失项与正交项组成的掩码引导散度损失函数(MDL)。经验与理论分析表明,MDL损失在自然训练中同时提升了模型的鲁棒性与泛化性。然而,采用CTR的自然训练在模型鲁棒性提升上仍不及对抗训练。因此,针对对抗训练,我们提出标准差损失函数(STD),通过最小化错误类别概率之间的差异,将其集成到对抗训练损失函数中以降低CT。经验与理论分析表明,基于STD的损失函数可在保证自然准确率不变或略有提升的基础上,进一步提升对抗训练模型的鲁棒性。
引用
@article{arxiv.2206.00913,
title = {Improving the Robustness and Generalization of Deep Neural Network with Confidence Threshold Reduction},
author = {Xiangyuan Yang and Jie Lin and Hanlin Zhang and Xinyu Yang and Peng Zhao},
journal= {arXiv preprint arXiv:2206.00913},
year = {2022}
}
备注
Under review