损失函数与目标表示对对抗鲁棒性的影响
机器学习
2020-03-09 v3 机器学习
摘要
理解和评估神经网络在对抗环境下的鲁棒性是一个日益受到关注的主题。文献中提出的攻击通常针对以最小化交叉熵损失并输出softmax概率训练的模型。在本工作中,我们给出了有趣的实验结果,表明考虑其他损失函数和目标表示的重要性,具体而言:(1)以均方误差训练;(2)将目标表示为由随机码本生成的码字。我们使用现有攻击评估了实现这些改进的神经网络的鲁棒性,显示出针对无目标攻击的准确率提升高达98.7%,以及有目标攻击成功率降低高达99.8%。即便面对专为我们的改进而定制的攻击,我们的模型也表现出比其常规对应模型更强的鲁棒性。此外,我们发现改进模型的参数具有显著更小的Lipschitz界,这是与模型对对抗扰动的敏感性相关的一项重要度量。
引用
@article{arxiv.1812.00181,
title = {Effects of Loss Functions And Target Representations on Adversarial Robustness},
author = {Sean Saito and Sujoy Roy},
journal= {arXiv preprint arXiv:1812.00181},
year = {2020}
}
备注
8 pages, 4 figures. Accepted at MLSys 2020 First Workshop on Secure and Resilient Autonomy